- Dr. Serdar Özcan
- 0 Yorumlar
- 154 Görüntüleme
xAI yeni sesli modelini yayınladı. Ama bizim için asıl önemli olan 5 Ağustos’ta.
xAI, sesli asistanlar için yeni konuşmadan konuşmaya (speech-to-speech) modelini yayınladı. Metrikleri iyi ama sesli asistanlar ile çalıştırıyorsanız, duyurunun sizin için en önemli satırı bir takvim tarihi.
|
%82,9
Konuşmadan Konuşmaya Endeksi (1.0: %75,7)
|
0,70 sn
İlk SesİN DUYULMASINA Kadar GEÇEN Süre (1.0: 1,25 sn)
|
0,4x
Muhakeme Tokeni Kullanımı (1.0 = 1,0x)
|
5 Ağu
grok-voice-latest 2.0’a Geçiyor
|
xAI ne duyurdu?
29 Temmuz’da xAI, sesli asistan geliştirenlere yönelik yeni konuşmadan konuşmaya modeli Grok Voice Think Fast 2.0’ı duyurdu. Fiyatı, ses dakikası başına 0,08 dolar.
Bağımsız değerlendirme kuruluşu Artificial Analysis’in konuşmadan konuşmaya endeksinde 2.0, %82,9 ile listenin başına geçti. Önceki sürüm 1.0 %75,7, GPT-Realtime-2.1 %79,1, Gemini 3.1 Flash %69,5 aldı.
Bu endeksin nasıl oluşturulduğunu bilmek faydalıdır, çünkü tek bir sayı üç ayrı yeteneği gizlemektedir. Artificial Analysis endeksi eşit ağırlıklı üç bölümden oluşuyor: konuşma muhakemesi (Big Bench Audio), konuşma dinamiği (Full Duplex Bench alt kümesi) ve ajansal performans (τ-Voice). Konuşma dinamiği duraklama yönetimini, söz almayı, araya girmeyi ve onay seslerini ölçüyor. τ-Voice ise havayolu, perakende ve telekom senaryolarında uçtan uca müşteri hizmeti görevinin tamamlanmasını inceliyor.
Bu şekilde ayırınca tablo daha anlamlı hale geliyor. Ajansal performans açısından 2.0, %56,5 ile açık ara önde; karşısında GPT-Realtime-2.1 %45,7 ve Gemini 3.1 Flash %37,7 oranında kalıyor. Konuşma dinamiğinde ise tablo başka. 2.0, %95,1 alırken GPT-Realtime-2.1, %95,7 ile hafifçe önde. Her ikisi de aynı aralığa giriyor, dolayısıyla bu eksende iki model fiilen eşit seviyede
Gecikme süresi net biçimde iyileşmiş. İlk sesin duyulmasına kadar geçen süre 1,25 saniyeden 0,70 saniyeye inmiş. Aynı ölçümde GPT-Realtime-2.1, 1,21 saniye, Gemini 3.1 Flash, 2,99 saniye. xAI ayrıca akıl yürütme token kullanımının medyan değerinin 1.0 sürümüne kıyasla 0,4 katına düştüğünü ve 24 dilde test edilen transkripsiyon doğruluğunun 1.0 sürümüne göre 1,4 kat iyileştiğini bildiriyor.
Takvimdeki asıl madde
Duyurunun içinde tek satırlık bir takvim maddesi yer alıyor: 5 Ağustos 2026’da grok-voice-latest takma adı, grok-voice-think-fast-1.0‘dan grok-voice-think-fast-2.0‘a geçecek.
Kodunuzda bu takma ad belirtilmişse, o gün sesli asistanınızın altında yatan model sizin bir şey yapmanıza gerek kalmadan değişecek. Çünkü yükseltmenin tarihi tedarikçinin takviminde yer alıyor.
İşte incelik burada: yeni modelin daha iyi olması, aynı davranacağı anlamına gelmiyor. Canlı bir telefon hattında üç şey aynı anda değişiyor.
- Gecikme profili. İlk sesin duyulma süresi yarıya düştüğünde, söz alma ritmi de buna bağlı olarak değişir. Söz kesme eşikleriniz, sessizlik zaman aşımlarınız ve “henüz konuşmamı bitirmedim” durumları için ayarladığınız değerler, farklı bir modele göre kalibre edilmişti.
- Araç çağrısının zamanlaması. Muhakeme tokeni kullanımı 0,4 katına düşmesiyle, araç çağrıları konuşmanın daha erken aşamalarında gerçekleşiyor. Bir arama, asistan daha ilk cümlesini bitirmeden önce sonuç verebilir. Bu iyi bir şey, ama akışınız o cevabın daha geç geleceğini varsayıyorsa iyi bir şey olmayabilir.
- Transkripsiyonun çıktısı. Metne dökme davranışı değişince niyet sınıflandırıcınızın gördüğü girdi de değişir. Sınıflandırıcıyı eski çıktı üzerine eğittiyseniz veya eşiklerini ona göre seçtiyseniz, bu eşikler artık başka bir dağılıma bakıyor demektir.
Bunların hiçbiri xAI’ın hatası olarak değerlendirilemez. Takma adların amacı zaten tam da bu değişiklikler içindir ve xAI geçiş tarihini önceden duyurmuştu. Asıl mesele, bu takma adı sahada sessizce kullanmanın ne anlama geldiğidir: sürüm kararını tedarikçinize devretmiş oluyorsunuz.
Aynı benchmark ailesi, iki farklı rakam
Yaptığımız araştırma sırasında beklemediğimiz bir şey çıktı ve bu, bu yazının en faydalı kısmı olabilir.
Nisan ayında 1.0 sürümü piyasaya çıktığında, xAI’ın kendi duyurusuna dayanan haberler τ-voice Bench skorunu %67,3 olarak vermişti. MarkTechPost, 25 Nisan tarihli yazısının başlığına da bu rakamı kullanmıştı. Artificial Analysis ise aynı 1.0 sürümünün τ-Voice bileşenini %52,1 ölçmüştür.
Aynı benchmark ailesi, iki ayrı ölçüm ama arada 15 puan fark var. Bu farkın nereden geldiğini bilmiyoruz. Değerlendirme ortamı, alt küme seçimi, çalışma zamanı ayarları ya da başka bir şey olabilir; kaynaklarda açıklaması olmadığı için burada tahmin yürütmeyeceğiz.
Operatör açısından çıkan sonuç yine de net. Üreticinin kendi sayfasında yayınladığı skor ile bağımsız bir kuruluşun ölçtüğü skor ciddi biçimde ayrışabiliyor. Her ikisi de yararlı göstergelerdir. Ancak trafiğinizi bunlardan hiçbiri etkilemez.
Telefon hatlarında sesli asistan çalıştıran bir ekip bunu nasıl yorumlamalı
TAO AI LAB olarak işletmeler için gerçek telefon çağrılarına, Türkçe ve İngilizce yanıtlar veren sesli asistanlar geliştiriyoruz. Altyapıda Vapi kullanıyoruz ve sistemi Squads özelliğiyle kuruyoruz: her departman için ayrı bir asistan.
Bu topoloji, model değişimi sorusunu daha da karmaşık hale getiriyor. Vapi’nin dokümanlarına göre model asistan bazında yapılandırılıyor, yani her departmanın asistanı kendi model ayarını taşıyor. Squad seviyesinde ise membersOverrides var: bir squad’daki bütün asistanların ayarlarını, alttaki asistanlara dokunmadan tek seferde geçersiz kılıyor. Yani model iki ayrı katmanda tanımlanabilir. Bir sürümü sabitleyecekseniz her ikisini de bilmeniz gerekiyor, çünkü Vapi’nin API tanımına göre önce asistan bazındaki ayar uygulanıyor, sonra global override onun üzerine biniyor.
Bir de devir noktaları var. Squads’te asistanlar birbirine handoff aracıyla devrediyor ve konuşma bağlamı devirle birlikte taşınıyor; her devirde ne kadar geçmişin aktarılacağını siz seçiyorsunuz. Devir, bir konuşmanın zamanlamaya en duyarlı anı. Gecikme profili değiştiğinde ilk bozulmanın görüneceği yer büyük ihtimalle burasıdır.
Bundan yola çıkarak bizim tarafımızda iki uygulama ortaya çıkıyor.
Birincisi, üretim ortamında belirli sürümleri sabitlemek. Takma ad geliştirme ortamında rahatlık sağlar. Canlı bir ortamda ise modelin adını ve davranışını değiştirebilecek bir yapılandırma değeri sayılır ve yapılandırma değerleri sabitlenir.
İkincisi, model değişimini bir dağıtım işlemi gibi ele almak. Yeni bir sürüme geçiş; belirli bir tarihi, bir doğrulama çalışması ve bir geri alma planı olan bir iştir. Kendiliğinden gelen bir yükseltme ise bu üç adımı da atlar.
Bu tablonun işaret ettiği bir üçüncü uygulama daha var: sabit bir test çağrısı seti. Kayıtlardan seçilmiş belirli sayıda tipik arama, yeni modele karşı çalıştırılıp eski modelin verdiği sonuçlarla karşılaştırılır. Bu benchmark testi size modelin ortalama bir görevde nasıl performans gösterdiğini gösterir. Ancak sizin müşterinizin aksanı, ürün adlarınız ve hattınızdaki gürültüyle nasıl başa çıktığı konusunda bir bilgi vermez. Bunu size ancak kendi kayıtlarınız söyleyebilir.
Benim samimi görüşüm şu ve nerede yanıldığımı duymak isterim. Sesli asistanlar alanında rekabet gitgide model seçiminden çıkıp modelin etrafındaki katmana doğru kaymaya devam ediyor. 0,70 saniyelik ilk yanıtı herkes sağlayabilir. Bunu tutarlı bir konuşmaya dönüştürmek ise sizin işiniz.
Bu konuda henüz netleşmemiş olan hususlar
Bu değerlendirmenin doğruluğunu sınırlayan üç husus var. Birincisi, 1.0 sürümünün dakika fiyatını doğrulanabilir bir kaynakta bulamadık, dolayısıyla iki sürüm arasındaki fiyat değişimi hakkında herhangi bir yorumda bulunmuyoruz. İkincisi, Artificial Analysis tek bir bağımsız değerlendirici kuruluşudur ve endeksi üç veri kümesine dayanmaktadır; bu, kendi arama trafiğinizin yerini tutmasa da yararlı bir referanstır. Üçüncüsü, xAI’ın kendi duyuru sayfasına erişemedik, bu yüzden rakamlar bağımsız ölçüm kuruluşunun sayfasından ve 29 Temmuz tarihli haber kaynağından alınmıştır.
Yön yine de oldukça açık. Sesli modeller hızlanmaya ve ucuzlamaya devam ediyor, sürüm döngüleri ise giderek kısalıyor. Bu hızda ayakta kalmayı başaran ekipler, en yeni modeli ilk deneyenler kadar, model değiştiğinde neler olacağını önceden bilen ekipler olacaktır.
Sıkça sorulan sorular
Grok Voice Think Fast 2.0 nedir?
xAI’ın 29 Temmuz 2026’da duyurduğu konuşmadan konuşmaya modeli. Sesli asistan geliştiren geliştiricilere yönelik ve ses dakikası başına 0,08 dolar fiyatlanıyor.
5 Ağustos 2026’da ne olacak?grok-voice-latest takma adı, 1.0 sürümünden 2.0 sürümüne kendiliğinden geçiyor. Bu takma adı kullanan uygulamalar o tarihten sonra yeni modele bağlacak.
Think Fast 2.0 her ölçümde rakiplerinin önünde mi?
Hayır. Genel endekste ve ajansal görev tamamlamada öndedir. Konuşma dinamiği bileşeninde %95,1 ile GPT-Realtime-2.1’in %95,7’sinin hafifçe gerisinde.
Sesli asistanımda takma ad yerine sabit sürüm mü kullanmalıyım?
Üretim ortamında, sabitlenmiş bir sürüm, yükseltme zamanlamasını size bırakır. Takma ad ise yeni modeli otomatik olarak getirir; bunun karşılığında geçiş tarihini tedarikçiniz belirler.
Sesli bir asistan, altında yatan model kadar istikrarlıdır. Bu istikrarı sağlayan katmanı biz oluşturuyoruz. Sesli veya asistan sistemleri kullanıyorsanız, size bir soru: Bir sonraki model yükseltme tarihini kim belirleyecek, siz mi yoksa tedarikçiniz mi? Yorumlarda bana yazın.
Kaynaklar
- TestingCatalog, Grok Voice Think Fast 2.0 lansmanı (29 Temmuz 2026)
- Artificial Analysis, konuşmadan konuşmaya model karşılaştırması (endeks skorları ve ilk sese kadar süre)
- Artificial Analysis, konuşmadan konuşmaya endeksinin duyurusu (bileşenler ve ağırlıklandırma)
- MarkTechPost, Grok Voice Think Fast 1.0 ve τ-voice Bench %67,3 (25 Nisan 2026)
- Vapi dokümantasyonu, Squads (çoklu asistan konuşmaları, asistan başına model yapılandırması ve membersOverrides)