deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak MIT Technology Review – AI topic

Move 37'den on yıl sonra, bir AlphaGo kurucusu LLM'lerin hâlâ akıl yürütemediğini savunuyor

AlphaGo'nun Lee Sedol karşısındaki zaferinden on yıl sonra, sistemin kurucularından biri MIT Technology Review'de LLM'lerin akıl yürütme değil, sezgiyi taklit ettiğini savunuyor ve bunu düzeltmek için AlphaGo tarzı bir mimari çiziyor.

Move 37'den on yıl sonra, bir AlphaGo kurucusu LLM'lerin hâlâ akıl yürütemediğini savunuyor

AlphaGo'nun inşasına yardım eden bir araştırmacı, programın Lee Sedol'e karşı oynadığı dönüm noktası niteliğindeki maçın üzerinden geçen on yılını keskin bir savunmayla işaret etti: zincir düşünme (chain of thought) yoluyla düşünüyormuş gibi görünenler de dahil olmak üzere büyük dil modelleri, anlam taşıyan herhangi bir biçimde akıl yürütüyor değil. Google DeepMind'dan yakın ayrıldığını söyleyen yazar, MIT Technology Review'deki yazısında mevcut yapay zekâ ilerlemesini bir sezginin ölçeklendirilmesi olarak çerçeveliyor ve sezginin tek başına, bilimde ve tıpta beklenen güvenilir ve gerçekten özgün sonuçları doğurmayacağı konusunda uyarıyor.

Move 37 sezgi değil, aramaydı

Yazı, Mart 2016'da Seul'de oynanan maçın ikinci oyununa dönüyor; AlphaGo'nun beşinci çizgiye taşı koyması bazı yorumcular tarafından başlangıçta bir programlama hatası sanılmıştı. Beş oyunluk seriyi 4-1 kaybeden Lee Sedol, daha sonra bu hamlenin ona programın yalın bir hesap makinesi değil, yaratıcı olduğuna ikna ettiğini söyledi. Yazara göre bu popüler okuma mekanizmayı tersten ele alıyor.

AlphaGo işbirliği yapan iki parçadan oluşuyordu. Güçlü bir insan oyuncunun ne yapacağını tahmin etmek üzere eğitilmiş policy network, bu hamlede özel bir şey görmüyordu — yazar, ağın bir uzman tarafından seçilme ihtimaline kabaca on binde bir verdiğini belirtiyor. Move 37'yi asıl seçen, arama mekanizmasıydı: programın taahhütte bulunmadan önce inşa edip değerlendirdiği, her biri olası bir geleceği temsil eden binlerce dallı açık bir oyun ağacı. Deep Blue'un 1997'de Garry Kasparov karşısındaki satranç zaferiyle — insan yazımı kurallar altında saniyede yaklaşık 200 milyon pozisyon inceleyen — yapılan karşıtlık burada önemli: Go, kaba kuvvetin umutsuz kalacağı kadar karmaşıktı; bu yüzden AlphaGo'nun daha dar ve daha derin bir aramaya rehberlik etmesi için sinir ağlarından gelen sezgilere ihtiyacı vardı.

Yazar bu ayrımı Daniel Kahneman'ın hızlı ve otomatik System 1 düşünce ile yavaş, adım adım System 2 arasındaki ayrımına eşliyor. AlphaGo'nun ağları sezgileri sağlıyordu; araması ise düşünmeyi sağlıyordu; ikisi de tek başına move 37'yi üretemezdi.

Chain of thought hâlâ System 1

Bir LLM ise buna karşılık tekrar tekrar bir sonraki token'ı seçiyor — hızlı, çağrışımsal örüntü tamamlama; yazar bunu dosdoğru System 1 ile özdeşleştiriyor. ChatGPT'nin çıkışının ardından benimsenen chain-of-thought prompting, özellikle matematik ve kodlamada gerçek kazanımlar getiriyor. Ancak yazarın anlatımında ara adımlar da tam olarak aynı sonraki-token süreciyle üretiliyor; yanıt verilmeden önce yalnızca daha uzun süre çalıştırılıyor. Bu ayrı bir düşünme mekanizması değil.

Yazıya göre üç belirli boşluk ortaya çıkıyor. Birincisi, modeller kendi epistemik durumlarının açık, kalıcı ve incelenebilir bir kaydını tutmuyor — göz önünde bulundurulan hipotezlerin, güven düzeylerinin, tartılan kanıtların ya da çözüm bekleyen açık soruların bir defteri yok. İkincisi, bir modelin bildikleri ile bu bilgiyi nasıl manipüle ettiği arasında temiz bir ayrım yok; ikisi de ağ ağırlıklarına dolanmış durumda. Üçüncüsü, araştırmalar modellerin sergilediği akıl yürütme izlerinin çoğu zaman事后 uydurulduğunu göstermiş: model yanıtına bir yoldan ulaşıyor ve başka bir yolu raporluyor.

Genel akıl yürütme için AlphaGo tarzı bir mimari

Bu eleştiri, yazarın DeepMind'dan ayrılma nedeni. Önerilen alternatif, AlphaGo'nun temel veri yapısını ödünç alıyor. AlphaGo güncellediği ve sonunda bir hamleye dönüştürdüğü açıklamalı bir oyun ağacını tutarken, genel bir akıl yürütme sistemi, neyin kesinleştiğini, neyin kuşkulu olduğunu, neyin elendiğini ve hangi soruların açık kaldığını kaydeden açık bir epistemik durum tutmalı. Akıl yürütme o zaman bu durumu değiştiren bir dizi işleme dönüşüyor — sonuçlar türetme, problemleri ayrıştırma ve hangi sorunun sorulacağına, hangi hesabın çalıştırılacağına ya da bundan sonra hangi deneyin yapılacağına karar verme.

İki tasarım öğesi öne çıkıyor. Bağımsız bir bileşen, her adımı gerçekten ne kadar belirsizlik çözdüğüne göre değerlendirecek ve inanç güncellemelerine yalnızca kanıt desteklediğinde izin verecek; böylece sistem sertifikalı bilgi biriktirebilecek ve geçmiş akıl yürütme bölümlerinden öğrenebilecek. Ve LLM'in kendisinin de hâlâ bir rolü var: bir problemi çözme yolları önermek, API'ler veya kod aracılığıyla araçlar çağırmak ve iddiaların mevcut kanıtlarca desteklenip desteklenmediğini değerlendirmeye yardım etmek. Açık dünya akıl yürütmesi Go'dan daha zordur — mevcut durum yalnızca kısmen bilinir, olası eylemlerin kümesi büyüktür ve değişkendir, sonuçlar belirsizdir — ama yazar, sinir modellerinin böyle bir sistemin içinde sezgi katmanı olarak hizmet edecek kadar yetkin hale geldiğini savunuyor.

Neden önemli

Bu, bir kıyaslama sonucundan çok, bir uygulayıcının gerekçelendirilmiş bir konumu. Ama yazarın belirttiği pratik çıkarlar somut: tıbbi teşhistе, mühendislikte ve bilimsel araştırmada nihai bir yanıt yeterli değildir — bir şey ters gittiğinde, hatanın akıl yürütmede mi, kanıtta mı yoksa temel varsayımlarda mı yattığını izleyebilmeniz gerekir. Yazının kapanış iddiası şu: System 1'i büyütmek yalnızca sezgiyi keskinleştirir; onu düşünür yapmaz. Bu bakış açısına göre, ilaç keşfinde, malzeme biliminde, iklimde ve teşhistе move 37'nin makine eşdeğerleri, yalnızca daha büyük modeller değil, açık akıl yürütme mekanizmalarına sahip mimariler gerektirecek.

  • #llms
  • #reasoning
  • #alphago
  • #deepmind
  • #machine-learning

İlgili yazılar