deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Brood War Bench: uç seviye AI ajanları StarCraft'ı hâlâ yeni başlayan seviyesinde oynuyor

Herkese açık bir benchmark, uç seviye AI modellerini tam StarCraft: Brood War maçlarından geçirdi. Codex Astra oynadığı her maçı kazandı, ancak hiçbir ajan yeni başlayan seviyesinin üzerine çıkamadı ve uzun akıl yürütme molaları çoğu zaman getirdiğinden fazla kaybettirdi.

Brood War Bench: uç seviye AI ajanları StarCraft'ı hâlâ yeni başlayan seviyesinde oynuyor

Yeni bir herkese açık benchmark, uç seviye AI modellerini tam StarCraft: Brood War maçlarının kontrolüne soktu ve dikkat çeken bulgu alçakgönüllü: Brood War Bench raporuna göre modellerden hiçbiri yeni başlayan seviyesinin ötesinde oynayamadı. 19 Eylül tarihli ve Hacker News ana sayfasında öne çıkan raporda, ajanlar komut grupları göndererek tam maçlar oynuyor. Bir konfigürasyon katıldığı her maçı kazandı, yine de yazarın değerlendirmesi açık sözlü: basit bir photon rush uygulayan insan bir yeni başlayan bu maçların tamamını kazanırdı.

Benchmark bir yan projeden doğdu. Yazar, yalnızca ajanlarla oynanabilen bir Brood War sürümü geliştirdi ve neredeyse hiç StarCraft deneyimi olmayan arkadaşlarının, ajanlarından saldırmasını isteyerek şaşırtıcı derecede iyi performans gösterdiğini fark etti. Bu, ajanların kendi başlarına ne kadar ileri gidebileceği sorusunu gündeme getirdi ve rapor bu sorunun yanıtı.

Tablonun gösterdiği

En yüksek efor ayarındaki Codex Astra, 18 galibiyet ve hiç yenilgiyle, yani %100 kazanma oranıyla tablonun zirvesinde yer aldı; dakika başına ortalama 12.6 aksiyon ve maç başına 10.54 dolarlık maliyetle oynadı. Onu 16-2'lik skorla orta eforlu Codex Astra, üçüncü sırada ise 15-3'lük skorla Claude Fable izledi. İlk onun geri kalanını, daha düşük eforlu bir Codex Astra koşusu, Codex 5.6'nın üç varyantı ve maç başına 20.78 dolarla en pahalı katılımcılardan biri olan 12-6'lık Claude Opus 5 oluşturdu.

Grok 4.6 alanın en dibindeydi; rapor, mevcut Grok modellerinin henüz oyunu oynayabilecek kapasitede olmadığı sonucuna varıyor. Dikkat çekici bir biçimde, Codex 5.6 Sol ailesi içinde orta efor ayarı oyunların %72.2'sini kazanırken, maksimum akıl yürütme ayarı %61.1'de kaldı; yazar bunu, gerçek zamanlı bir oyunda düşünerek geçirilen sürenin rakibin hamle yaptığı süre olduğuna dair bir kanıt olarak okuyor.

Maçlar kısaydı. Medyan maç süresi Codex Astra için 8:10, Grok 4.6 için 9:15 ve Claude Fable için 10:37 oldu; Astra maçlarının en büyük payı, %54.9 ile beş ile on dakika arasında sona erdi.

Düşünmenin vergisi

Rapor, karar gecikmesini merkezî zafiyet olarak ele alıyor. Eski modeller gerçek zamanlı strateji oyununu sıra tabanlıymış gibi oynadı ve düşünmenin ortasında yok edildiler. Yeni modeller akıl yürütmenin maliyetinin çok daha farkında, ama yine de aynı tuzağa düşüyor.

Grok 4.6 uç örneği oluşturuyor. 43 dakikalık bir maçta en yüksek eforlu koşusu 11.138 reasoning token üretti ama yalnızca altı komut grubu gönderdi ve hiç savaş birimi çıkarmadı. Diğer maçlarında üç Marine ya da iki Zealot üretti ve hiç haritayı geçmedi. Toplu grafikler de aynı hikâyeyi anlatıyor: birleştirilen koşularda Grok 4.6 ortalama yaklaşık yedi hayatta işçi, kabaca iki birimlik bir ordu ve 500'den fazla harcanmamış mineralle oynarken, Codex Astra ve Claude Fable 15-17 işçiyi ayakta tuttu ve supply sayıları 26-27 civarında seyretti.

Üç model, üç profil

Codex modelleri makroyu keşfetmeden önce tacizi keşfetti. En güçlü tekrarlayan fikirleri, işçilere saldırmak için harita boyunca tek bir Probe göndermekti; bu büyük ölçüde, rakip ajanların durum üzerinde onlarca saniye düşünüp donakalması sayesinde işe yaradı. Sürekli üretim çok daha zayıftı: gecikmiş tech, savunulan üslere damla damla giren temel birimler ve son savunmalara fırlatılan işçiler. Codex ayrıca ekonomi, ordu üretimi ve ordu kontrolü için ayrı subagent'lar oluşturma eğilimindeydi ve bunlar neredeyse hiç iletişim kurmuyordu; sonuçta ordu ajanı planlı bir timing için yığınmak yerine birimleri saldırılara tek tek yolluyordu; klasik bir yeni başlayan hatası. Sağlam anlar da yok değildi: bir maçta ordusunu ve ana üssünü kaybettikten sonra Codex 5.6 Terra son Command Center'ını haritanın uzak köşesine uçurdu ve altı dakika daha hayatta kaldı.

Claude Fable, oyunu tam anlamıyla oynamaya en yakın olan oldu. Bir ekonomi kurdu ve ilk elde edilen birimde durmak yerine tech ağacında tırmandı; bir maçı Mutalisk'lere ulaştıktan sonra, bir başkasını ise Robotics Facility, Citadel of Adun, Observatory ve Templar Archives inşa ettikten sonra kazandı. Ancak hırs icraatı garanti etmiyordu: üçüncü bir maçta Factory ve Academy'ye ulaştı, sonra Claude Opus 5 onu ezdi.

Neden önemli

Gerçek zamanlı ortamlar, statik benchmarkların gözden kaçırdığı bir başarısızlık modunu ortaya çıkarıyor: düşünmenin maliyeti. Brood War'da gecikme birinci sınıf bir yetenek kısıtıdır ve parlak biçimde akıl yürüten ama seyrek hareket eden bir model, hareket eden modele yenilir.

Sonuçlar ayrıca kazanma oranının bir sinyal olarak kullanılması konusunda bir uyarı. Buradaki %100'lük rekor, yetkinliği değil, zayıf ajanlar arasındaki göreceli gücü ölçüyor; yazar, liderlerin bile karmaşık ordular kuramadığını, basit saldırıları savamadığını ya da somut stratejiler uygulayamadığını belirtiyor.

Ajan ekonomisi açısından, daha ucuz ve düşük eforlu ayarların bazen maksimum akıl yürütmeden iyi çıkması bulgusu, daha fazla düşünmenin her zaman daha iyi olduğu varsayımını tersine çeviriyor. Ve yazar, benchmark'ın hiçbir şekilde tükendiğini düşünmüyor: genel amaçlı LLM ajanları, gerçek zamanlı stratejinin talep ettiği gözle-karar ver-hareket et döngüsünü hâlâ sürdüremiyor ve bu, bir sonraki model nesline büyük bir gelişim alanı bırakıyor.

  • #ai-agents
  • #benchmarks
  • #llms
  • #starcraft
  • #real-time-strategy

İlgili yazılar