· kaynak MIT Technology Review – AI topic
Çocuklar 30 milyon kelimeden dil öğrenirken LLM'ler neden trilyonlarca kelimeye ihtiyaç duyuyor
MIT Technology Review, veri verimliliği açığını inceliyor: küçük çocuklar 10-30 milyon kelime duyduktan sonra dilbilgisel konuşmaya ulaşırken, LLM'ler trilyonlarca token üzerinde eğitiliyor. Bu farkın açıklanması gelecekteki model tasarımını şekillendirebilir.

Çocuklar, ana dillerinin temellerini, modern bir AI laboratuvarını utandıracak kadar küçük bir veri kümesi üzerinde rutin olarak öğreniyor. MIT Technology Review'ye göre, küçük çocuklar 10 ile 30 milyon arasında kelime duyduktan sonra dilbilgisel cümleler üretmeye başlarken, büyük dil modelleri eğitim sırasında çok daha fazla metin tüketiyor. Veri verimliliği açığı olarak bilinen bu uyumsuzluk, hem bilişsel bilimciler hem de sınır modellerin mimarları için acil bir araştırma sorunu haline geldi.
Açığın büyüklüğü
Rakamlar sezgiye karşı direniyor. MIT Technology Review, bir LLM'nin bir insanın ana dilini öğrenirken karşılaştığı kelimelerin kabaca yüz bin katı kadar kelime işleyebildiğini bildiriyor. Meta'nın açık ağırlıklı Llama 3.1 modeli ön eğitim sırasında 15 trilyon token tüketmiş durumda ve Georgetown Üniversitesi'nden bilişsel bilimci ve dilbilimci Ethan Gotlieb Wilcox, yayına, sınır modellerin bundan on kat daha fazlasıyla eğitiliyor olabileceğini söyledi. Buna karşılık, dil açısından zengin bir evde büyüyen bir çocuk, okuma dahil edildiğinde 20 yaşına gelene kadar belki 300 milyona ulaşan, yaklaşık 100 milyon kelime duymuş olabilir.
Wilcox bir benzetme sunuyor: Claude "bir bütün şehrin bir nesilde deneyimleyeceği dil miktarını görmüş" durumda. Kağıda basılsaydı, modern bir modelin eğitim külliyatı Uluslararası Uzay İstasyonu'nun ötesine uzanırken, bir çocuğun 100 milyon kelimesi yaklaşık 20 metre yüksekliğinde yığılırdı.
Karşıtlık küçük uçta da geçerli. Stanford'da bilişsel bilimci olan Michael C. Frank, GPT-2'yi 30 milyon kelime üzerinde eğitmenin "bir saçmalık üreteci" ortaya çıkardığını gözlemliyor. Onun deyişiyle: "Çocuk elde etmiş olmuyorsunuz."
Makinelerle yeniden canlanan eski bir tartışma
Çocukların bunu nasıl başardığı hâlâ gerçekten gizemli ve bu soru AI'dan on yıllar önceye dayanıyor. 1950'lerde Noam Chomsky, B.F. Skinner'ın dilin yalnızca koşullanma ve pekiştirme yoluyla edinildiğine davioran davranışçı görüşüne karşı çıktı. "Uyaranın yoksulluğuna" referans veren Chomsky, çocukların duyduğu konuşmanın geliştirdikleri dilbilgisini açıklamak için fazla seyrek olduğunu, dolayısıyla bazı yapısal bilginin doğuştan olması gerektiğini savundu. Kaliforniya Üniversitesi Irvine'dan dilbilimci ve bilişsel bilimci Richard Futrell, Chomsky'nin temel iddiasını MIT Technology Review'ye, dilin yalnızca istatistik temelinde öğrenilemeyeceği argümanı olarak özetliyor.
O konum erken bilişimi şekillendirdi. Chomsky'nin üretici dilbilgisi Amerikan dilbilimini domine etti ve on yıllar boyunca doğal dil işlemeyi yönlendiren kural tabanlı, sembolik yaklaşımi etkiledi; bu çaba gerçek dili ölçekli biçimde ele almada büyük ölçüde başarısız oldu ve 1970'lerde başlayan AI kışı ile soğudu. Yalnızca 2010'larda sinir ağları, ucuz donanım ve büyüyen bir internet bir araya geldi ve transformer modelleri BERT ile GPT-2, devasa veri hacimlerinden öğrenmenin işe yarayabileceğini gösterdi. ChatGPT'nin 2022'de gelişi bu yaklaşımı varsayılan hale getirdi, ancak bu durum çocukların çok daha az şeyle nasıl başardığı konusunda hiçbir şey söylemiyor.
Neden önemli
AI geliştiricileri için açık, merak konusundan kısıt haline kayıyor. Son on yıldaki model iyileştirmelerinin çoğu ölçek büyütmeden geldi, ancak internet o kadardır ve MIT Technology Review, kolayca erişilebilir eğitim verisinin 2030'lardan itibaren tükenebileceğine dikkat çekiyor. Çocuklar, akıcı dilin girdinin çok küçük bir kesitinden öğrenilebileceğinin işleyen bir varlık kanıtı ve bunu nasıl yaptıklarının tersine mühendisliği, çok daha veri verimli mimarilere işaret edebilir.
Pratik uygulamalar somut. Daha iyi öğrenme verimliliği, modelleri video üzerinde etkili biçimde eğitmayı ve devasa yazılı külliyatı olmayan azınlık dili toplulukları için chatbot'lar oluşturmayı mümkün kılabilir.
Bilişsel bilim için ise trafik ters yönde akıyor. Makine modelleri, uzun süredir doğrulanmaya direnen insan öğrenmesine dair hipotezler için bir test yatağı sunuyor: bir dil içgüdüsüyle doğup doğmadığımız ve dil işlememizin insan biyolojisinin bir tuhaflığı mı yoksa dillerin nasıl öğrenilebileceğine dair evrensel kısıtları mı yansıttığı. Chomsky ve Skinner ile başlayan bir tartışma şimdi, en azından kısmen, kodla çözülebilir.
- #llms
- #language-acquisition
- #cognitive-science
- #data-efficiency
- #ai
İlgili yazılar
- Eski LinkedIn SRE'si, yapay zekâ ile olay yönetiminin mühendislerin sistem bilgisünü aşındırdığı konusunda uyarıyor
- SWE-Bench ProMax: en iyi model büyük çok dilli refactoring görevlerinin yalnızca yüzde 41,2'sini çözebiliyor
- Robotik veri girişimi XDOF, stealth'ten çıkışından üç ay sonra 1,2 milyar dolarlık Series B için görüşüyor