· kaynak Hacker News – Front Page (native)
Ataraxos AI, tarihin en iyi Stratego oyuncusunu yalnızca 16 GPU ile yendi
Ataraxos adlı bir yapay zekâ, Stratego efsanesi Pim Niemeijer'i dört beraberlikle birlikte 15 maçta bir yendi ve bilgisayarlara direnen bir gizli bilgi oyununu çözdü — üstelik sadece 16 GPU ile.

Ne oldu
Oyun oynayan yapay zekâlara inatla direnen klasik bir masa oyununun çözüldüğü bildiriliyor. Ars Technica'ya göre, Carnegie Mellon, MIT, New York Üniversitesi ve Stanford'u kapsayan bir araştırma ekibi, Pim Niemeijer'i — tarihin en güçlü Stratego oyuncusu olarak kabul edilen isim — dört beraberlikle birlikte 15 maçta bir yenen Ataraxos adlı bir sistem geliştirdi. Modelin eğitiminin reportedly sadece 16 GPU ve birkaç bin dolar aldığı belirtiliyor.
Stratego neden makineleri zorladı
Satranç, Go ve poker yıllar önce bilgisayarlara yenildi: Deep Blue 1997'de Garry Kasparov'u, AlphaGo 2016'da Lee Sedol'u yendi ve poker botları yıllardır profesyonelleri yeniyor. Stratego ise direnmeyi sürdürdü. Ars Technica'nın bildirdiğine göre, olağanüstü bir bütçeye sahip DeepMind bile, en iyi insan oyuncuları güvenilir biçimde yenebilen bir makine üretemedi.
Zorluk, kuralların içine işlemiş durumda. Her oyuncu, mareşalden casusa kadar askeri rütbeleri temsil eden 40 taşla, bombalar ve bir bayrakla oynar; düşman bayrağını ele geçirmek kazanmayı sağlar. Rakipler taşlarının nerede olduğunu görür ama ne olduğunu göremez. Kimlikler yalnızca iki taş çarpıştığında ortaya çıkar; zayıf taş oyundan çıkar ve galibin rütbesi açığa çıkar.
Bu, Stratego'yu poker gibi eksik bilgiye dayalı bir oyun hâline getirir — ama çok daha büyük bir ölçekte. Çalışmanın ortak yazarlarından MIT bilgisayar bilimci Gabriele Farina, Texas Hold'em'de bir oyuncunun yalnızca iki gizli kart taşıdığını ve 1.326 olası el ortaya çıktığını, bu alanın bir makine tarafından eksiksiz değerlendirilebilecek kadar küçük olduğunu belirtiyor. Buna karşılık Stratego'da 40 taş, bir desilyondan fazla olası dizilimde yerleştirilebilir. Oyunlar ayrıca çok daha uzun sürüyor: Farina'ya göre bir satranç oyunu genellikle yaklaşık 40 hamle sürerken, bir Stratego oyunu kolayca 2.000 hamlere uzayabiliyor.
Blöf problemi
Aldatma zorluğu katlıyor. Oyuncular bazen zayıf bir taşı sanki mareşalmiş gibi oynatarak rakibi korkutmayı umar. Çok sık blöf yaparsanız tehditler inandırıcılığını yitirir; hiç blöf yapmazsanız oyununuz tahmin edilebilir hâle gelir. Araştırmacılar, bu dengeyi yönetmenin 2022'de tanıtılan DeepMind'ın DeepNash gibi önceki sistemleri devirdiğini söylüyor.
Çalışmanın ortak yazarlarından NYU araştırmacısı Eugene Vinitsky, oyunu farklı kılan şeyi şöyle anlattı: "Stratego'da çok belirgin bir şey var: Oyun, çok uzun bir zaman ölçeğinde açığa çıkan muazzam miktarda gizli bilgi içeriyor."
Neden önemli
Stratego, satranç, Go ve poker'in her birinin yalnızca kısmen ortaya koyduğu üç sorunu bir araya getirdi: devasa bir gizli durum, son derece uzun oyunlar ve stratejik blöf. Üçüne birden hâkim olan bir sistem, salt arama gücünün bir gösteriminden ziyade eksik bilgi araştırmaları için ayrı bir dönüm noktası anlamına geliyor.
Bütçe de en az bunun kadar dikkat çekici. Önceki dönüm noktası niteliğindeki oyun oynayan sistemler yoğun işlem gücüne sahip büyük laboratuvarlardan çıktı, ancak Ataraxos'un reportedly birkaç bin dolara 16 GPU ile eğitildiği bildiriliyor; bu da bu alandaki sınır sonuçlarının artık endüstri ölçeğinde kaynaklar gerektirmediğini düşündürüyor. İlerlemesini klasik oyunlarla ölçen bir alan için, inatla direnen son kalelerden biri artık düştü.
- #stratego
- #artificial-intelligence
- #game-theory
- #imperfect-information
- #machine-learning