- Dr. Serdar Özcan
- 0 Yorumlar
- 75 Görüntüleme
Speechmatics sesli asistanlar için bir model geliştirdi. Karşılaştırma tablosu “doğru” kelimesinin tek bir anlamı olmadığını söylüyor.
Speechmatics ve LiveKit, 27 Ağustos’ta sesli asistanlar için özel olarak geliştirilen konuşma tanıma modeli Linden’i duyurdu. Duyuru açık bir karşılaştırma tablosuna işaret ediyor. Asıl ilginç olan da o tablo, çünkü en düşük kelime hata oranı ile en yavaş yanıt süresi aynı satırda duruyor.
|
%1,07
Birleştirilmiş (pooled) en düşük kelime Hata Oranı, Tablonun En Düşüğü
|
%83,2
Kusursuz transkript oranı (Zirve: %84,7)
|
495 ms
Ortanca Gecikme süresi (En Hızlı: 221 ms)
|
55+
Linden’in Desteklediği Dil
|
Duyurulan ne
Speechmatics ve LiveKit, 27 Ağustos 2026’da ortak bir duyuru yayınladı. Speechmatics’in sesli asistanlar için özel olarak geliştirdiği ilk model olan Linden artık LiveKit Inference üzerinden kullanılabiliyor. LiveKit Inference, LiveKit’in ses modellerini tek bir yerde topladığı katmandır. Halihazırda bu platformda geliştirme yapan ekipler, arayüz üzerinden veya kodda bir dakikadan kısa bir sürede geçiş yapabilirler.
Bu çözüm, belirli bir dizi hatayı hedeflemektedir: belirgin aksanlar, ikinci bir dil konuşan kişiler ve kalitesiz bir hat üzerinden okunan hesap veya kart numaraları gibi alfanümerik diziler. Linden, 55 veya daha fazla dili desteklemektedir. Bu sürüm ayrıca LiveKit temsilcilerine ilk kez konuşmacı ayrıştırma (diarization) özelliğini getiriyor; böylece bir temsilci, bir aramayı tek bir bölünmemiş kelime akışı olarak ele almak yerine, kimin ne söylediğini ayırt edebilmektedir.
Modelin etrafındaki parçalar LiveKit Inference tarafından korunur: hat kurgusu, yönlendirme, faturalama ve asistanın ne zaman konuşmaya başlayacağını belirleyen sıra tespiti.
Karşılaştırma tablosunu doğru okumak
Duyuru, gerçek zamanlı asistanlar için konuşma tanıma servislerini değerlendiren açık kaynaklı Pipecat STT benchmark testine işaret ediyor. Test 1.000 örnek üzerinde gerçekleştiriliyor ve dört metrik grubunu raporluyor: anlamsal kelime hata oranı, son segmente kadar geçen süre, metne dökme başarı oranı ve kusursuz olarak geri dönen metinlerin oranı. Anlamsal hata oranı (WER), yalnızca modelin sonraki aşamalarında anlam değişikliğine yol açan hataları sayar; noktalama işaretleri, dolgu sözcükleri ve sayı biçimlendirmeleri skoru şişirmiyor.
Tablonun Speechmatics için gösterdiği rakamlar şunlar: %1,07 birleştirilmiş hata oranı (WER), %1,40 ortalama hata oranı (WER), %83,2 kusursuz metin oranı ve 495 ms ortanca gecikme süresi, P95’te (95. yüzdelik) 676 ms, P99’da (99. yüzdelik) ise 736 ms.
%1,07, tablodaki en düşük birleştirilmiş hata oranıdır ve gerçek bir sonuçtur. Bir sütun yana bakınca sıralama değişiyor. AssemblyAI’ın universal-3-5-pro modeli %84,7 kusursuz metin döndürüyor, Speechmatics’in %83,2’sinin üzerinde. Cartesia ink-2 %84,2, Soniox stt-rt-v4 %84,1, AssemblyAI u3-rt-pro %83,9 ve Soniox stt-rt-v5 %83,3 seviyesinde; yani bu sütunda Speechmatics altıncı sırada. Toplam hata sayısı en az olan model, diğer beş modele kıyasla daha az sayıda çağrıyı tam olarak doğru tanımlıyor.
Gecikme süresi bu ayrımı daha da belirginleştiriyor. NVIDIA’nın yalnız İngilizce çalışan Nemotron 3.0 ASR modeli 221 ms ortanca, Deepgram nova-3-general 247 ms, Soniox 249 ms veriyor. Speechmatics 495 ms’de duruyor, en hızlısının kabaca iki katı. Bir telefon görüşmesinde bu fark duyulabilir. Bu fark, asistanın cevap vermesinden önceki duraklamada ortaya çıkar; bu da arayanların farkında olmadan değerlendirdikleri kısımdır.
Yine bir üretici beyanı ve bir kıyaslama sayısı
Speechmatics kendi sitesinde, LiveKit entegrasyonunu tanıtan yazısında şunu beyan ediyor: gerçek dünya testlerinde sıradaki sağlayıcıdan %25 daha iyi. Şirketin işaret ettiği açık karşılaştırma testi ise bu rakamı ortaya koymuyor.
Birleştirilmiş hata oranı (WER) sonuçlarına göre, ikinci en iyi sonuç %1,18 ile Azure’a ait olup, bu da yaklaşık %9’luk bir fark anlamına geliyor. %1,22’lik bir sonuç elde eden AssemblyAI ile karşılaştırıldığında ise fark yaklaşık %12’dir. Her iki rakam da yayınlanmış veriler üzerinden yaptığım hesaplamalara dayanmaktadır.
“Gerçek dünya testleri” bu karşılaştırma testinden başka bir şeyi kastediyorsa, her iki durum da doğru olabilir. Şirket, %25’lik sonucun hangi testten çıktığını belirtmiyor; bu nedenle biz de tahminde bulunmayacağız. Bir model seçen herkes için önemli olan nokta net ve pratiktir: Bir şirket açık bir karşılaştırma testine atıfta bulunup aynı zamanda bir rakam verdiğinde, bu rakamın o karşılaştırma testinden gelip gelmediğini kontrol edin.
Bu durumla tekrar tekrar karşılaşıyoruz. Temmuz ayında aynı desene rastlamıştık: aynı kıyaslama ailesinde üreticinin duyurduğu skor ile bağımsız bir laboratuvarın ölçtüğü skor arasında 15 puan fark vardı.
Gerçek bir telefon hattında bunun karşılığı
TAO AI LAB olarak işletmeler için pek çok projelerin yanında, gerçek telefon hatlarını yanıtlayan Türkçe ve İngilizce sesli asistanlar da geliştiriyoruz. Vapi üzerinde, Squads özelliğiyle çalışıyoruz: her departman için ayrı bir asistan. LiveKit kullanmıyoruz, dolayısıyla bu duyuru bizim için açıp kapatacağımız bir anahtar değil. Bunun bizim için önemli olmasının nedeni, etkilediği katman ve bu katmanın her platformda mevcut olmasıdır.
Bir çağrı çoğunlukla farkedilmeden, metne dökme aşamasında bozuluyor. Arayan kişinin aksanını model daha az duymuş olabilir. Kişi ikinci dilinde konuşuyor oluyor olabilir. Arkada televizyon açıkken rezervasyon numarasını okuyor olabilir. Bunların hiçbiri bir hata mesajı olarak görünmez. Bunun yerine, kimsenin sormadığı bir soruyu yanıtlayan bir asistan ortaya çıkar ve arayan kişi, sistemin çalışmadığına karar verir.
Bu yüzden tablodaki asıl kıymetli kısım manşetteki rakamlardan çok sonuçlardaki farklılıktır. Bir sesli asistanın hem metni doğru çıkarması hem de cevaba hızlı başlaması gerekiyor. Bu tablo ise iki hedefin birbiriyle çeliştiğini gösteriyor. Benim yorumum: Bu bir tercih meselesi ve liste başında seçmek yerine, kullanım durumuna göre karar verilmeli. Kullanıcıların sayıları dikte ettiği bir hat, doğruluk uğruna birkaç yüz milisaniyelik gecikmeyi göze alabilir. Hızlı bir diyalog üzerine kurulu bir hat ise bunu göze alamaz.
Buradan çıkan ikinci şey, bir karşılaştırma testinin neleri yapamayacağıdır. Bu test, başkaları tarafından seçilen 1.000 örnek üzerinde çalışır. Arayan kişinin aksanını, ürün adlarınızı ya da hattınızdaki gürültüyü hiç duymamıştır. Bu tür rakamlar, aday listesini daraltmak için yararlıdır ancak nihai kararı vermek için yetersiz kalabilir.
Bunun netleştiremediği hususlar
Üç sınırlama var. Birincisi, duyuru sayfasını doğrudan açamadık; buradaki duyuru ayrıntıları haberlerden ve LiveKit ile Speechmatics belgelerinden derlendi. İkincisi, kıyaslamanın kendi depo sayfası bu rakamların hangi tarihli çalıştırmaya ait olduğunu belirtmiyor ve sağlayıcılar yeni sürüm çıkardıkça sonuçlar değişiyor; bu nedenle tabloyu bir anlık görüntü olarak ele almak gerekiyor. Üçüncüsü, bu sayıların hiçbiri Türkçe ses verileri üzerinde üretilmedi; oysa asistanlarımızı Türkçe için de geliştiriyoruz, dolayısıyla bizim için bu tablo bir cevaptan çok başlangıç noktasıdır.
Sıkça sorulan sorular
Linden nedir?
Speechmatics’in sesli asistanlar için özel olarak geliştirdiği konuşma tanıma modeli. 27 Ağustos 2026’da LiveKit ile birlikte duyuruldu, LiveKit Inference üzerinden kullanılabiliyor ve 55’in üzerinde dili kapsıyor.
En düşük kelime hata oranı, en iyi model demek mi?
Tek başına değil. Pipecat kıyaslamasında Speechmatics %1,07 ile en düşük birleştirilmiş hata oranına sahip; buna karşılık kusursuz metin oranında beş model onun üzerinde, tepede %84,7 ile AssemblyAI var, ve birkaç servis kabaca yarı süresinde cevap veriyor.
Anlamsal kelime hata oranı (WER) nedir?
Yalnızca metni okuyan model açısından anlamı değiştiren hataları sayan bir hata oranı. Noktalama, dolgu sözcükleri ve sayı biçimlendirmesi hesaba katılmıyor.
Metne dökme doğruluğu telefon hattında neden daha kritik?
Çünkü aksan, ikinci dilde konuşma, dikte edilen numaralar ve arka plan gürültüsü aynı anda geliyor ve bir metne dökme hatası, arayan kişiye hata mesajı yerine yanlış cevap olarak ulaşıyor.
Sesli asistanlar, teknik özellik listesinde kimsenin belirtmediği unsurlar üzerinden değerlendirilir ve biz de sohbeti bir arada tutan katmanı oluşturuyoruz.
Size bir sorum var: Açıkça daha iyi bir konuşma metni elde etmek için yanıt süresinden 250 milisaniye ödün vermek zorunda kalsanız, bu takası kabul eder miydiniz? Yorumlarda görüşlerinizi paylaşın.
Kaynaklar
- Speechmatics ve LiveKit, “Speechmatics and LiveKit target the accuracy gap breaking voice agents in production” (27 Ağustos 2026)
- Pipecat STT kıyaslaması, ölçütler ve sonuç tablosu (anlamsal hata oranı, son segmente kadar süre, kusursuz metin oranı)
- LiveKit belgeleri, Speechmatics konuşma tanıma
- Speechmatics, sesli yapay zeka asistanları için konuşma teknolojisi