· kaynak Google AI blog
Google, yapay zekâsının artık dünyadaki nüfusun %86'sının konuştuğu 300'den fazla dili desteklediğini açıkladı
Google, ürünlerinin ve yapay zekâ modellerinin artık 7 milyardan fazla insanın konuştuğu 300'den fazla dilde çalıştığını belirtti. Şirket, az temsil edilen dillere yönelik yeni konuşma modellerini, cihaz üzerinde çeviriyi ve veri ortaklıklarını ayrıntılarıyla anlattı.

Google, yapay zekâ teknolojilerinin artık 7 milyardan fazla insanın konuştuğu ve dünya nüfusunun %86'sını temsil eden 300'den fazla dilde günlük etkileşimleri güçlendirdiğini açıkladı. Şirket, bu kilometre taşını ve arkasındaki çalışmaları 15 Eylül'de Google AI blogunda yayımladığı bir yazıda ele alarak, teknolojinin uzun süredir az sayıda baskın dil için en iyi şekilde çalışırken diğer binlerce dili çevrimiçi ortamda yetersiz şekilde bıraktığını savundu. Aşağıdaki tüm rakamlar Google'ın kendi açıklamasından alınmıştır.
Metne ihtiyaç duymayan konuşma modelleri
Google'a göre geleneksel konuşma sistemleri katı bir pipeline'a dayanıyordu: sesi metne dönüştür, metni işle, sonra yeniden sese dönüştür. Bu tasarım; ton, tempo, duygu ve bağlamı ortadan kaldırıyor ve insanların gerçekten konuşma biçimiyle — duraksamalar, üst üste binen konuşmalar ve tek bir cümle içinde Spanglish veya Hinglish gibi dillerin karışmasıyla — zorlanıyor. Google, bunu yakalamak için Gemini gibi modelleri doğrudan sesle çalışacak ve hem sesi hem niyeti kavrayacak şekilde eğitmeye yöneldiğini söylüyor.
Blogda, kod değiştirme (code-switching) ve duygusal ipuçlarını ele alırken 70 dilde ve 2.000'den fazla dil çiftinde gerçek zamanlı konuşmalı çeviri sunan Gemini 3.5 Live Translate'a yer veriliyor. Bunun karşılığı olan Gemini 3.5 Transcribe, Google'ın şimdiye kadarki en doğru konuşmadan metne modeli olarak tanımlanıyor; gürültülü ortamlarda ve özelleşmiş jargonla bile düzgün ve biçimlendirilmiş metin üretiyor. Transcribe ayrıca Android'deki Gboard'ın Rambler özelliğini güçlendiriyor; bu özellik dolgu kelimelerini kaldırıyor, dilbilgisi ve noktalamayı düzeltiyor ve kullanıcılara diller arasında geçiş yaparak metni sesle düzenleme veya yeniden yazma imkânı tanıyor.
1.000 Diller Girişimi (1,000 Languages Initiative) kapsamında Google, dünyanın en çok konuşulan 1.000 dilini desteklemeyi hedefliyor. Universal Speech Model, 12 milyon saatlik ses verisiyle eğitildi ve veri bakımından zengin dillerden öğrenilen örüntüleri çok daha az eğitim verisine sahip dillere uygulayan diller arası aktarım öğrenmesi (cross-lingual transfer learning) kullanıyor. Google, bu çabanın 25 yıllık araştırmaya ve konuşma alanında 400'den fazla hakemli makaleye dayandığını söylüyor.
Yerel ortaklıklarla veri toplama
Web, az sayıda baskın dili orantısız biçimde yansıttığı için Google, veri toplama yöntemini yeniden düşünmesi gerektiğini ve yerel düzeydeki ortaklıklara yöneldiğini belirtiyor. Açık veri projeleri arasında, Makerere University ve Digital Umuganda ile birlikte geliştirilen, Wolof dilinde "konuşmak" anlamına gelen WAXAL; 26'dan fazla ülkede 100 milyondan fazla insanın konuştuğu 27 Sahra Altı Afrika dilini kapsayan bir konuşma veri seti yer alıyor. Indian Institute of Science ve Bhashini ile yürütülen Project Vaani, toplamayı dil yerine bölgeye göre organize ediyor ve şimdiye kadar 155.000'den fazla konuşmacıdan 109 dilde 30.000 saatten fazla konuşma derledi.
Üçüncü bir çaba olan Amplify Initiative, yerel nüansları yakalayan 15.000 multimodal veri noktası katkıda bulunmaları için dört kıtada 1.600'den fazla yerel uzman ve 20 üniversiteyi görevlendirdi. Google ayrıca, dünyadaki en büyük açık kaynak dil veri havuzu olarak tanımladığı LinguaMeta için bir görselleştirme aracı olan Language Explorer'ı tanıttı; araç, 7.000'den fazla konuşulan, yazılan ve işaret dilini sürekli olarak haritalıyor. Google.org ise çok dilli araçları çiftçilere, sağlık çalışanlarına ve öğretmenlere ulaştırmayı amaçlayan Centre for Digital Language Inclusion ve AI Singapore'nun Project Aquarium çabalarını ayrıca destekliyor.
İnternet bağlantısı olmadan çeviri
Google, güvenilir internete 3 milyardan fazla insanın hâlâ erişemediğine dikkat çekiyor. Yazılımsal yanıtı, Gemini'den türetilmiş ve 55 dilde eğitilmiş hafif açık çeviri model ailesi TranslateGemma: bu modeller cihaz üzerinde çalışıyor, böylece çeviri artık bulut bağlantısı gerektirmiyor. Hâlâ özellikli telefon (feature phone) kullanan yüz milyonlarca insan için Google, temel cihazlara Gemini'yi taşıyan Viamo'nun AVA sesli asistanını destekliyor; Ruanda'da etkileşimli sesli yanıt kullanıcılarıyla yapılan pilot uygulamanın ardından hizmet, Gemini destekli 2 milyondan fazla soruya yanıt verdi.
İşaret dili ve yerel telaffuz
Erişilebilirlik konusunda Google, 50'den fazla işaret diliyle eğitilmiş Sign Language-to-Text (SL2T) modelini tanıttı. Model, Pixel 11'de Gboard ve Live Transcribe'da işaret dilinden metne dikte imkânı sağlıyor ve bu, ilk aşamada Amerikan İşaret Dili'nden İngilizceye yönelik — dünyada işaret diline güvenen yaklaşık 70 milyon insana hizmet yolunda atılmış erken bir adım. Yeni Zelanda'da Google, Maps'in yer adlarını nasıl telaffuz ettiğini iyileştirmek için Māori dili uzmanlarıyla çalıştı ve kültürel olarak otantik telaffuzları metinden sese modellerine dahil etti.
Neden önemli
Dil teknolojilerinin çoğu az sayıda baskın dil için geliştirildi ve milyarlarca konuşmacıya, iletişim biçimlerini kısmen ya da tamamen kaçıran araçlar bıraktı. Google'ın kapsam iddiaları şirketin kendi hesaplamalarının ötesinde doğrulanırsa, topluluk tarafından toplanan verilerin, cihaz üzerindeki modellerin ve özellikli telefon erişiminin birleşimi, yapay zekâyı bulut öncelikli araçların büyük ölçüde atladığı nüfuslara taşıyacaktır. Bu duyuru ayrıca yapay zekâdaki rekabetin nereye gittiğinin bir sinyali: ham model kalitesi artık temel bir beklenti haline gelirken, diller, cihazlar ve bağlantı düzeyleri across olarak erişim farklılaştırıcı unsur haline geliyor. Her satıcı kilometre taşı yazısında olduğu gibi rakamlar denetlenmemiş durumda; ancak çok dilli ve çevrimdışı çalışabilen yapay zekâya yöneliş, izlemeye değer bir trend.
- #translation
- #speech-recognition
- #multilingual-ai
- #accessibility