· kaynak dev.to (home feed)
Microsoft'un MAI-Transcribe-2'si 60 dili kapsıyor, saatte 0,10 dolarlık fiyatla en iyi doğruluğu iddia ediyor
Microsoft AI'ın MAI-Transcribe-2'si 60 dili transkribe ediyor, kendi testlerinde FLEURS benchmark'ının zirvesinde yer alıyor ve saatte 0,10 dolarlık ses fiyatıyla OpenAI, Google ve ElevenLabs'ı maliyet açısından geride bırakıyor.

3 Eylül 2026'da Microsoft AI, 60 dili kapsayan ve yaygın olarak kullanılan bir benchmark'ta zirve iddiasında bulunan en yeni konuşmadan metne modeli MAI-Transcribe-2'yi yayınladı. Duyurunun dev.to'daki özetine göre şirket, modeli piyasadaki en hızlı, en doğru ve en ucuz transkripsiyon seçeneği olarak konumlandırıyor; tanıtım fiyatı ses başına saatte 0,10 dolar.
Benchmark'lar ne gösteriyor
Microsoft'un ana iddiası, Google araştırmacılarının 2022'de yayınladığı ve ana dili konuşanların 102 dilde yaklaşık 2.000 cümle okuduğu FLEURS benchmark'ına dayanıyor. MAI-Transcribe-2'nin desteklediği 60 dilde ortalama %5,2'lik bir kelime hata oranı elde ettiği ve bunun Microsoft'a göre ilk sıraya yerleştirdiği bildiriliyor.
Özellikle Tay dili için model %3,4'lük kelime hata oranıyla Microsoft'un karşılaştırma tablosundaki en iyi sonucu paylaşıyor; Gemini 3.5 Transcribe'ın %3,8'inin, Gemini 3.1 Pro'nun %4,7'sinin, OpenAI'nin GPT-transcribe'ının %5,4'ünün, ElevenLabs'ın Scribe v2'sinin %6,1'inin ve Whisper v3-large'ın %8,7'sinin önünde yer alıyor.
Bağımsız ölçümler tabloya nüans katıyor. Modelleri herkese açık API'ler üzerinden test eden Artificial Analysis, MAI-Transcribe-2'yi kelime hata oranı sıralamasında ikinci sıraya yerleştirirken, modelin doğruluk ve gecikme süresi açısından Pareto sınırında olduğunu, yani hiçbir rakibin daha yavaş olmadan daha doğru ya da daha az doğru olmadan daha hızlı olmadığını belirtiyor. Ham hızda Microsoft, modelin Artificial Analysis değerlendirmelerine göre OpenAI'nin GPT-Transcribe'ından yaklaşık 10 kat, ElevenLabs'ın Scribe v2'sinden 7 kat ve Google'ın Gemini 3.5 Transcribe'ından 5 kat daha hızlı olduğunu söylüyor.
Yeni yetenekler
Dil sayısı Nisan'daki ilk sürümde 25 ve Haziran'daki v1.5 güncellemesinde 43 iken şimdi 60'a ulaştı; bu da modeli Microsoft AI'ın beş ay içindeki üçüncü transkripsiyon modeli yapıyor. Yeni sürüm, üretim iş yüklerini hedefleyen özellikler de ekliyor:
- Konuşmacı ayrıştırma (speaker diarization), çok kişilik kayıtlarda metni tek tek konuşmacılara atıyor
- Arama, düzenleme ve altyazıları videoya senkronize etme için yararlı olan kelime düzeyinde zaman damgaları
- Anahtar kelime yönlendirmesi (keyword biasing), geliştiricilerin ilaç adları, ürün kodları veya çalışan adları gibi listeler sunarak özel terimlerin doğru şekilde transkribe edilmesini sağlıyor
- Hinglish ve Spanglish gibi cümlenin ortasında dilleri karıştıran konuşmalar için code-switching desteği
- İki çıktı modu: hukuki ve uyumluluk çalışmaları için dolgu kelimelerini ve tereddütleri koruyan birebir (verbatim) mod ve okunabilir altyazılar için bunları temizleyen sade mod
Fiyatlandırma ve maliyet tartışması
Saatte 0,10 dolarlık lansman fiyatı yıl sonuna kadar geçerli promosyon niteliğinde ve beş ay önce ilk model için alınan saatte 0,36 dolarlık ücrete göre yaklaşık %72'lik bir düşüş temsil ediyor. VentureBeat kurumsal açılımı şöyle özetledi: yılda 100.000 saat çağrı merkezi sesi transkribe eden, büyük bir banka veya telekom için tipik bir hacim bu, bir kuruluşun faturasının 36.000 dolardan 10.000 dolara düşeceğini görüyor; transkripsiyon böylece bir bütçe tartışması olmaktan çıkıp rutin bir kalem haline geliyor.
dev.to'daki yazının da belirttiği gibi, yüksek iş hacmi fiyatlandırmanın kendisini de destekliyor; çünkü daha hızlı bir model aynı iş yükü için daha az GPU saati tüketiyor. Geliştiriciler modeli Microsoft Foundry, MAI Playground ve OpenRouter üzerinden deneyebilir.
Stratejik arka plan
Sürüm, Microsoft'un kendi ön cephe modellerini (frontier models) bir seferde bir modalite olarak inşa etmesi ve ürünlerinde OpenAI teknolojisini kademeli olarak bunlarla değiştirmesi şeklindeki daha geniş bir örüntüye uyuyor; transkripsiyonun en hızlı ilerleyen alan olduğu bildiriliyor. Microsoft AI CEO'su Mustafa Suleyman, The Verge'e verdiği demeçte ilk transkripsiyon modelinin bürokrasiden uzak tutulan yaklaşık on kişilik bir ekipten geldiğini ve karşılaştırılabilir ön cephe modellerinin yaklaşık yarısı kadar GPU maliyetiyle çalıştığını söyledi.
Dikkate değer uyarılar
Benchmark rakamları satıcı tarafından bildirilen rakamlar ve en güçlü sayılar Microsoft'un kendi karşılaştırma tablolarından geliyor. FLEURS özellikle arka plan gürültüsü, çapraz konuşma ve üst üste binen konuşmacıların olduğu gerçek dünya sesi yerine ana dili konuşanların okuduğu konuşmayı kullanıyor; bu yüzden üretim ortamındaki doğruluk büyük ölçüde dağıtım senaryosuna bağlı olacak.
Neden önemli
İddialar doğruysa, saatte 0,10 dolara ve benchmark lideri doğrulukla transkripsiyon, sesi metne dönüştürmeyi toplantılar, altyazılar, medya arşivleri ve çağrı merkezi analitiği için fiilen ücretsiz bir altyapıya dönüştürüyor; güçlü Tay dili sonucu da kazanımın İngilizcenin çok ötesine ulaştığını gösteriyor. OpenAI, Google ve ElevenLabs için bu, Microsoft'un artık hem fiyat hem hız açısından kendi ortaklarıyla doğrudan rekabet ettiği anlamına geliyor. Ayrıca bu, Microsoft'un OpenAI'ye bağımlılıktan kendi bünyesindeki model yığınına geçişindeki bir gösterge daha; konuşma tanıma, bu geçişin görünür şekilde önde olduğu ilk cephe olarak ortaya çıkıyor.
- #microsoft
- #speech-to-text
- #ai-models
- #transcription
- #benchmarks