Microsoft kendi ses modelini geliştirdi: MAI-Voice-2 ve bunun sesli asistanlar için anlamı

 

Microsoft kendi ses modelini geliştirdi: MAI-Voice-2 ve bunun sesli asistanlar için anlamı

Pop filtresiyle birlikte siyah-beyaz çekilmiş bir stüdyo kondenser mikrofonu

Microsoft, 2 Haziran’da Build 2026’da kendi bünyesinde geliştirdiği yedi modeli duyurdu. Sektördeki analizlerin çoğu bu gelişmeyi “OpenAI ile doğrudan bir rekabet” olarak çerçeveledi. Benim dikkatimi çeken ise çok daha odaklı ve spesifik bir detay oldu: Bu modellerden biri, yani yeni ses modeli, “ultra düşük gecikmeli Sesli Asistanlar” için özel olarak tasarlanmıştı. Teknoloji dünyasının en büyük oyuncularından birinin, tam olarak bizim TAO AI LAB bünyesinde inşa ettiğimiz iş modelini “birincil kullanım senaryosu” olarak adlandırıp tescillemesi oldukça heyecan verici.

7
Kendi MAI Modeli
15
MAI-Voice-2’deki Dil
43
Transcribe-1.5’teki Dil
3
Lansmandaki Üçüncü Taraf Host

Sesli yapay zeka asistanları geliştiren bir şirket yönettiğim için, bu duyurunun ardından yayınlanan teknik dökümanları ve bağlantıları büyük bir merakla inceledim; temel motivasyonum “sahada dengelerin nasıl değiştiğini” görmekti. “Microsoft, OpenAI’a karşı” anlatısı bir geliştirici olarak benim için çok şey ifade etmiyor ancak yeni ses modelinin mimarisi her şeyi değiştirebilir. Azure’un arkasındaki dev, çok dilli bir ses modelini piyasaya sürüp bunu üstelik üçüncü taraf platformlara da açtığında, ses modeli artık bir rekabet bariyeri (moat) olmaktan çıkıp sipariş üzerine çağırılan standart bir ürüne dönüşür.

Bu yazının ana ekseni de tam olarak bu: Ses teknolojilerinde model katmanı hızla standartlaşıyor (metalaşıyor). Asıl katma değer yaratan iş ve küçük ekiplerin devlere karşı hâlâ kazanabileceği alan ise bir üst katmana, yani orkestrasyona taşınıyor.

1. Microsoft 2 Haziran’da ne duyurdu

Microsoft’un süper yapay zeka ekibi, 2 Haziran’da duyurulan Build 2026’da yedi adet şirket içi modelden oluşan bir aileyi piyasaya sürdü (Microsoft). Bu aile seti, geliştirici yığınının büyük bölümünü kapsıyor. Bir muhakeme modeli, bir kodlama modeli, bir transkripsiyon modeli, bir görüntü modeli ve benim en çok önemsediğim iki adet ses modeli bulunuyor.

MAI-Thinking-1 adlı akıl yürütme modeli, 256K bağlam penceresine sahip 35 milyar aktif parametreli, uzman modellerin karışımından oluşan bir modeldir ve açılış konuşmasında SWE Bench Pro’da %53 ve AIME 2025’te %97 puan aldığı belirtiliyor (Microsoft AI sunumu). Microsoft, değerlendiricilerin bu modeli Sonnet 4.6’ya tercih ettiğini ve kodlamada Opus 4.6 ile eşleştiğini söylüyor. Not edilmeye değer bir ayrıntı ise modelin OpenAI verisi olmadan eğitildiği aktarılıyor (Tech Times).

Kodlama modeli MAI-Code-1-Flash, 5 milyar parametreli bir model olup, Microsoft’un tanıtımında SWE Bench Pro’da %51’lik bir performans sergilediği ve küçük ve ucuz olması hedeflendiği belirtiliyor. Transkripsiyon modeli MAI-Transcribe-1.5, 43 dilde doğruluk iddiasında bulunuyor ve Microsoft’un ifadesiyle “rakip modellere göre 5 kata kadar daha hızlı” çalışıyor. Görüntü modeli MAI-Image-2.5 ise Microsoft’un belirttiği sıralamalarda ikinci sırada yer alıyor. Bu rakamların tamamını, lansman gününde Microsoft’un kendi verileri olarak sunulduğu için, kesin olarak kabul etmemek gerektiğini düşünüyorum.

2. MAI-Voice-2 canlı konuşma için tasarlandı

Microsoft’un ses modeli hakkında söylediği şey şu: MAI-Voice-2 “güzel tonlama, doğal sese yakın aktarım ve ince ayarlı duygu kontrolü” sunuyor ve 15 dilde piyasaya sürülüyor, daha fazlasının da geleceği vaat ediliyor. İkinci bir varyant, MAI-Voice-2-Flash ise “gecikmeye son derece duyarlı sesli asistanlar” için yapılmış olarak tanımlanıyor (Microsoft AI sunumu).

Bu varyantı tekrar okuyun, çünkü isimlendirme her şeyi açıklıyor. Birkaç yıl önce, yüksek kaliteli bir metinden sese dönüştürme modeli sesli kitaplar, anlatım ve erişilebilirlik için satılıyordu. Bunlar, yarım saniyelik ekstra gecikmenin önemli olmadığı sesli okuma işleriydi. Gecikmeye duyarlı sesli temsilciler için adlandırılan bir model ise tamamen başka bir şey için satılıyor: bir kişinin cümleyi bitirmesi ile temsilcinin cevap vermesi arasındaki boşluğun tüm deneyimi oluşturduğu canlı, iki yönlü bir konuşma.

Bu boşluk, sesli asistanların hayatta kalıp kalmadığını belirler. Cevap 200 milisaniye gecikirse, arayan kişi onun üzerine konuşur. Çok hızlı gelirse, konuşmayı keser. Ses modelini kalite ve gecikme katmanlarına ayıran bir üretici, gerçek zamanlı konuşmayı artık birincil iş yükü olarak ele aldığını söylüyor demektir. Bence bu çerçeveleme doğru ve büyük bir oyuncunun bunu onaylamasından memnunum.

Çok dillilik sayısı da önemli, ama sadece gösteriş amaçlı bir rakam olarak değil. Aynı görüşmede, bazen aynı cümlede Türkçe ve İngilizce arasında geçiş yapan asistanlar geliştiriyoruz. Paylaşımlı tonlama/vurgu kontrolüne sahip tek bir ses modelinde on beş dil, on beş ayrı tek dilli modelin bir araya getirilmesinden daha kullanışlıdır.

3. Bu bir kopuş değil, bir tedbir alma girişimidir

Loş bir odada sıra sıra renkli ışıklı düğme ve sürgüye sahip bir ses miksaj masası

Bu hafta çıkan haberlerin çoğu, sunulan şirket içi modelleri Microsoft’un OpenAI’den kopuşu olarak yorumladı. Bu yoruma dikkatli yaklaşmak gerekiyor. Azure hala OpenAI’yi birincil altyapısı olarak barındırıyor, GitHub Copilot hala OpenAI modellerini destekliyor ve Microsoft 365 Copilot hala OpenAI özelliklerini kullanıyor. Bunların hiçbiri 2 Haziran’da (CNBC) değişmedi.

Değişen şey, seçenek çeşitliliğidir. Microsoft artık yığın katmanının her seviyesinde (akıl yürütme, kodlama, transkripsiyon, ses ve görüntü) bir alternatif sunuyor. Bundan faydalanmak için OpenAI’den vazgeçmek zorunda değil. Sadece bunu yapabilmesi gerekiyor ki bu da herhangi bir müzakerede farklı ve daha kalıcı bir pazarlık gücü sağlıyor.

Dağıtım tercihi bunun altını çiziyor. Microsoft, MAI modellerinin yalnızca Azure içinde değil, Fireworks AI, Baseten ve OpenRouter’da da sunulacağını söylüyor. Bir hiper ölçekli şirketin kendi modellerini üçüncü taraf yönlendiricilere yerleştirmesi alışılmadık bir durum. Bu, Microsoft’un bu modellerin kendi bulutunun arkasına kilitlenmek yerine, yaygın olarak bileşen olarak kullanılmasını istediği anlamına geliyor. Bir geliştirici için dikkat edilmesi gereken nokta bu. MAI-Voice-2’yi, bir yönlendiricideki diğer herhangi bir modeli çağırdığınız gibi çağırabileceksiniz; bu da bir modeli tam olarak bir emtia parçası haline getiren şeydir.

4. Scout ve ajan platformu işi bir üst katmana taşıyor

Microsoft, modellerin yanı sıra, OpenClaw ve WorkIQ üzerine kurulu kişisel bir iş ajanı olan Microsoft Scout’u da tanıttı. Bu ajan, Teams ve Outlook gibi insanların zaten kullandığı araçların içine yerleştirilerek, her seferinde sorulmadan toplantı hazırlığı, zamanlama çakışmaları ve rutin görevleri halletmek üzere tasarlandı (Microsoft).

Ayrıca, kendi iş mantığı ve iş akışları etrafında kendi ajanlarını oluşturmak isteyen kuruluşlar için, şirketin Microsoft IQ olarak adlandırdığı bir bağlam katmanı üzerine kurulu bir Microsoft Agent Platformu da bulunmaktadır. Ve şirket genelinde ajanları izlemek ve güvence altına almak için Entra, Defender ve Purview’ı tek bir kontrol düzlemine genişleten bir yönetim ürünü olan Agent 365 de mevcuttur.

Bu üçünü bir araya getirdiğinizde Microsoft’un bahsinin şeklini görebilirsiniz. Modeller işin ucuz kısmı. Pahalı ve savunulabilir kısım ise işinizi bilen bağlam katmanı, araçlarınızda yaşayan ajan ve güvenlik ekibinin geceleri rahat uyumasını sağlayan yönetim düzlemidir. Microsoft modeli ticarileştiriyor ve üstündeki katmana sahip olmaya çalışıyor. Bu mantıklı bir strateji ve küçük laboratuvarların ölçek yerine odaklanma konusunda rekabet ettiği katman da tam olarak bu.

5. İtiraz edeceğim noktalar

Birkaç dürüst uyarıda bulunmak gerek, çünkü lansman günü haberleri genellikle sunumu olduğu gibi kabul etme eğilimde.

Rakamlar üreticinin kendi verileri. “Rakiplerden 5 kat hızlı”, “kodlamada Opus 4.6 ile eşit”, “skor tablosunda ikinci” gibi ifadeler Microsoft’un, Microsoft tarafından, dikkat çekilen rakamlar. Doğru çıkabilirler. Ama henüz bağımsız birileri tarafından kontrol edilmediler. Bunlardan herhangi birini gerçek diye kabul etmeden önce bağımsız transkripsiyon ve ses gecikmesi testlerini beklerdim.

Daha iyi bir ses modeli zor kısmı çözmüyor. Tonlama ve duygu kontrolü gerçek iyileştirmelerdir ve bunları memnuniyetle karşılıyorum. Ama canlı bir çağrıda sesli asistanı bozan şey nadiren sestir. Sıra alma, arayan beklenmedik bir şey söylediğinde durumu toparlama, asistanın durup bir insana teslim etmesi gereken durumlar. Daha duygusal bir konuşma sentezi modeli, iyi bir asistanı daha hoş bir asistan yapar. Kırılgan bir ajanı güvenilir olmaz.

OpenAI verileri olmadan eğitilmesi hâlâ yalnızca bir iddia. MAI-Thinking-1’in OpenAI verisinden kaçındığı yönündeki haberler doğruysa ilginç. Çünkü bu modellerin gerçekten ne kadar bağımsız olduğuna işaret ediyor. Ayrıca tam da dışarıdan kanıtlanması zor türden bir iddia. Şimdilik bunu not ediyorum ve güvenmeden önce kanıt bekliyorum.

6. Takip ettiğim üç şey

MAI-Voice-2-Flash gerçekten gerçek zamanlı gecikmeyi tutturuyor mu. Model bir gecikme katmanı vaat ediyor. Kanıt, canlı bir çağrıda uçtan uca rakamlar: mikrofondan ilk geri dönen kelimeye kadar, gerçek ağ koşulları altında. İlk bağımsız ölçümler, bunun hakiki bir gerçek zamanlı model mi yoksa iddialı pazarlamayla bezenmiş hızlı bir anlatım modeli mi olduğunu gösterecektir.

Üçüncü taraf barındırma nasıl işleyecek. MAI-Voice-2, OpenRouter ve benzer paltformlarda makul bir fiyatla yer alırsa, benimki de dahil olmak üzere her ses ekibi için geliştir-ya-da-satın-al matematiğini değiştirecektir. Pratikte kilitli ya da pahalı kalırsa, üçüncü taraf vaadi çoğunlukla bir basın satırı olur.

Ajan katmanı açık mı kapalı mı. Microsoft IQ, Scout ve Agent 365 Microsoft ekosistemi içinde güçlüdür. Açık soru, o ekosistemin dışında kurulan ajanların buna ne kadar iyi entegre olabileceğidir. Cevap, modelin üstündeki katmanın paylaşılan bir alan mı yoksa kapalı bir bahçe mi olduğuna karar verecektir.

TAO AI LAB TAO AI LAB Perspektifi

TAO AI LAB olarak işletmeler için, gerçek telefon hatları üzerinde, Türkçe ve İngilizce sesli ajanlar geliştiriyoruz. Dolayısıyla, büyük ölçekli bir şirketin gecikmeye duyarlı asistanları hedefleyen çok dilli bir ses modelini piyasaya sürdüğü bir hafta, tam olarak bizim çalışma alanımıza hitap ediyor. Bu durum bizi tehdit etmekten çok fayda sağlıyor.

Nedeni şu. Ses modeli zaten kazan. sağlayacağımız kısım değildi. Hiçbir küçük şirket, metinden sese dönüştürme konusunda Microsoft’u geçemez. Bizim kazanç sağlayacağımız yer, sunumun en az vakit ayırdığı katman: sesin etrafında olup bitenler. İnsana yakın hissettiren sıra alma. Arayan senaryodan saptığında toparlanma. Bunalan bir müşteriyi doğru anda bir insana devretme kararı. Çağrı bittikten sonra rezervasyon sistemine yapılan o sessiz geri yazma. Daha iyi bir ses modeli, bunların hepsini daha güzel gösterir. Ama bunların hiçbirini inşa etmez.

Bu yüzden standart bir ses modeli odaklanmış bir ekip için iyi haber. Sanki, pahalı ve kurması zor bir parçanın sipariş edebileceğimiz bir bileşen olarak gelmesi demek ve enerjimizin bir aramanın başarılı olup olmayacağına karar veren orkestrasyona yönelmesi anlamına geliyor. MAI-Voice-2’nin tek modelde çok dilli olması da doğrudan işimize yarıyor, çünkü tek bir aramada Türkçe-İngilizce geçişi bizim için bir demo özelliği değil, günlük bir gereksinim.

Geliştiriciler için üç sinyal:

  • Ses modelini değiştirilebilir bir parça olarak görün. Bir hiper ölçekli şirket ses modelini üçüncü taraf yönlendiricilere koyduğunda, model bir bileşendir. Ajanınızı yeniden oluşturmadan yılın bu çeyreğindeki en iyi ses modeline yönlendirme yapabilecek şekilde tasarım yapın, çünkü en iyi model sürekli değişecektir.
  • Enerjinizi modelin üstündeki katmana harcayın. Sıra alma, toparlanma, devretme ve kayıt sistemine geri yazma, çağrıların başarılı ya da başarısız olduğu yerdir. O katman aynı zamanda küçük bir ekibin büyüğü yenebileceği yer, çünkü ölçekten çok odağı ödüllendiriyor.
  • “Gerçek zamanlı” etiketine inanmadan önce bağımsız gecikme rakamlarını bekleyin. Sesli ajanlar için geliştirilmiş bir model bile canlı bir çağrıda uçtan uca gecikmesini kanıtlamak zorunda. Sunuma güvenmeden önce kendi trafiğinizde test edin.

Sıkça sorulan sorular

MAI-Voice-2 nedir?

Microsoft’un 2 Haziran’da Build 2026’da tanıttığı kendi ses modeli. Microsoft, bu modeli ince ayarlı duygu kontrolü ve doğal sese yakın aktarıma sahip ve 15 dilde kullanılabilen bir model olarak tanımlıyor. Gecikmeye duyarlı sesli asistanlara yönelik daha hızlı bir varyantı olan MAI-Voice-2-Flash olarak adlandırılan bir modeli daha var.

Microsoft Build 2026’da kaç model tanıttı?

Muhakeme, kodlama, transkripsiyon, görüntü ve sesi kapsayan yedi kendi MAI modeli. Muhakeme modeli MAI-Thinking-1, 256K bağlam penceresine sahip 35 milyar aktif parametreli bir modeldir.

Bu, Microsoft’un OpenAI’ı bıraktığı anlamına mı geliyor?

Hayır. Azure hâlâ OpenAI’ı birincil altyapı olarak barındırıyor ve Copilot hâlâ OpenAI modellerini kullanıyor. Kendi modelleri Microsoft’a her seviyede bir alternatif veriyor, ki bu bir kopuştan çok bir seçenek olarak okunmalı.

MAI modelleri nerede sunulacak?

Microsoft, modellerin yalnızca Azure içinde değil, Fireworks AI, Baseten ve OpenRouter dahil üçüncü taraf platformlarda da sunulacağını söylüyor; bu da onları bileşen olarak kullanmayı kolaylaştırıyor.

Microsoft Scout nedir?

Scout, OpenClaw ve WorkIQ üzerine kurulu kişisel bir iş ajanıdır. Teams ve Outlook gibi araçların içinde çalışıp toplantı hazırlığı, takvim çakışmaları ve rutin işleri proaktif olarak hallediyor.

Sıra sizde

Görüşüm şu, ve nerede yanıldığımı gerçekten duymak isterim. Ses modeli bu hafta artık en büyük engel olmaktan çıktı. Bir hiper ölçekli şirket, duygulu ve çok dilli bir konuşma sentezi modelini herkese açık bir yönlendiricide yayınladığında, model sanki sipariş ettiğiniz bir parçaya dönüşüyor ve asıl iş, onun etrafındaki orkestrasyona kayıyor. Küçük ve odaklı bir ekip bile o katmanı kendi kazancına dönüştürebilir.

Sesli sistemler ya da ajanlar geliştiriyorsanız, bunun nerede çöktüğünü söyleyin. Ses modeli hâlâ en zor probleminiz mi, yoksa zor kısım sizin için de zaten daha üst katmanlara mı taşındı?

Düşüncelerinizi yorumlara bırakın. Hepsini okuyup yanıtlıyorum.

Kaynaklar:

Leave A Comment