· kaynak Hacker News – Front Page (native)
GPT-6 Astra robot kollarını yönetiyor: blok alma-bırakmada 19/20, hassas yerleştirmede ise takılıp kalıyor
RoboCurve, GPT-6 Astra'ya fiziksel robot kollarının kontrolünü verdi: bloğu kâseye koyma görevinde Claude Fable 5.1'in 8/20'sine karşılık 19/20 başarı, yarı maliyetle — ancak hassas yapboz yerleştirmesinde berabere kaldılar.

Fiziksel donanımda bir frontier model
4 Eylül'de yayınlanan ve Hacker News ana sayfasına yükselen bir benchmark'ta RoboCurve, OpenAI'nin GPT-6 Astra'sına fiziksel iki kollu bir robot düzenegiın kontrolünü verdi ve Anthropic'nin Claude Fable 5 ile Fable 5.1'ini iki masaüstü manipülasyon görevinde onunla karşılaştırdı. Sonuç net bir ayrışma: Astra kaba alma-bırakma görevinde çarpıcı biçimde daha iyiydi, buna karşılık hassas bir yerleştirme görevindeki avantajı tamamen kayboldu.
Rapor, ekibin önceki Fable 5 ve Fable 5.1 karşılaştırmasının devamı niteliğinde. Astra birebir aynı kurulumda çalıştı: aynı YAM kolları, aynı Inspect Robots agent policy'si ve aynı iki görev; model başına görev başına 20 deneme ve toplamda sayılan 120 koşu.
Kâse görevi
Birinci görev basit bir alma-bırakmaydı: masadaki kırmızı bir bloğu kaldırıp bir kâsenin içine koymak. Rapora göre Astra bu görevi 20 denemenin 19'unda tamamladı; Fable 5.1 20'de 8, Fable 5 ise 20'de 1 başarı elde etti. Astra'nın koşuları ayrıca daha hızlıydı: deneme başına yaklaşık 2,5 dakika, Fable 5.1'de ise 6,8 dakika; maliyet de daha düşüktü, koşu başına tahmini 0,94 dolar'a karşı 2,12 dolar. Rapordaki özet grafikler bunu, yaklaşık 2,3 kat daha düşük maliyetle 2,4 kat daha yüksek tamamlama oranı olarak çerçeveliyor.
Yapboz görevi
İkinci görev ince motor kontrolü gerektiriyordu: yuvarlak mavi bir yapboz parçasğını merkezindeki tutamağından kaldırıp tahtadaki eşleşen dairesel oluk içine oturtmak. Burada Astra yerleştirmeyi 20 denemenin yalnızca 2'sinde tamamlayabildi — Fable 5.1'in sonucuyla aynı. Rapor, Astra'nın oluğa ulaştığını ama Fable modellerinin de takıldığı aynı son adımda durduğunu belirtiyor. Deneme başına maliyeti yine daha düşüktü, 1,36 dolar'a karşı 2,18 dolar, yaklaşık 1,6 kat daha ucuz; ancak yetenek farkı ortadan kalktı.
Değerlendirme nasıl yapıldı
Donanım, kol başına paralel çeneli tutuculara sahip, altı serbestlik dereceli bir çift I2RT YAM koluydu. Model doğrudan eklem komutları göndermiyor; kol başına mutlak uç efektör pozları konum, yönelim ve tutucu durumu — veriyor ve robotun ters kinematiği bunları eklem açılarına çeviriyor. Model her turda, proprioseptif durumla birlikte üç kamera görüntüsü görüyor: tepeden ve sol ile sağ bilek kameraları.
Agent policy her denemeyi 20 LLM çağrısıyla sınırladı, orta düşünme çabasıyla ve yüzde 25 hız sınırıyla çalıştı ve varsayılan güvenlik korumaları açık kaldı. Koşum takımı Inspect Robots 0.58.0 idi. Her deneme, ulaştığı beş aşamanın en ilerisine göre insan bir değerlendirici tarafından puanlandı: amaçlı yaklaşım yok, nesneyle temas, masadan tamamen kaldırma, bırakma noktasının üstüne konumlanma ve son olarak yerleştirme. Maliyetler, üç model için de liste fiyatıyla — milyon girdi ve çıktı token başına 10 ve 50 dolar — hat düzeyindeki istek ve yanıt tokenlarından hesaplandı.
Yazarların belirttiği uyarılar
Rapor zayıf yönleri konusunda alışılmadık derecede açık:
- Astra'nın denemeleri Fable denemelerinden iki gün sonra yapıldı ve onlarla karıştırılmadı.
- Yapboz karşılaştırması aynı düzeneği kullandı, ancak manşetteki kâse karşılaştırması kullanmadı: Fable modelleri rig-3'te koştu, Astra test edildiğinde rig-3 müsait değildi ve Astra rig-1'de test edildi.
- Değerlendirme, modelin kimliğini bilen operatör tarafından yapıldı; bu da bilinçdışı önyargıya yer bırakıyor.
- Maliyet karşılaştırmaları tam olarak simetrik değil: Anthropic istekleri prompt caching olmadan gönderilirken OpenAI, Astra'nın girdisinin yaklaşık beşte birini otomatik olarak önbelleğe aldı. Bu indirim rakamlara yansıtılmadığı için yazarlar, Astra'nın maliyetinin varsa abartılmış olduğunu söylüyor.
- Nesneler denemeler arasında elle yerine kondu ve her model yalnızca orta akıl yürütme çabasıyla çalıştırıldı.
Neden önemli
Frontier dil modellerinin gerçek robot donanımında kamuya açık olarak yüz yüze test edilmesi nadir görülür ve bu test iki pratik sinyal sunuyor. Birincisi, genel amaçlı alma-bırakma güvenilirliğe yaklaşıyor gibi görünüyor: koşu başına bir dolar civarında ve iki buçuk dakikada neredeyse kusursuz bloğu-kâseye-koyma, bir laboratuvar demosu değil kullanılabilir bir yetenek. İkincisi, başarısızlık örüntüsü dikkat çekici — en iyi performansı gösteren model, rakipleriyle tam olarak aynı son yerleştirme adımında takılıyor; bu da hassas hizalamanın robotların dil modeliyle kontrolünde vendöre özgü bir zayıflık değil, paylaşılan bir darboğaz olduğunu düşündürüyor.
Uyarılar önemli: manşetteki sonuç farklı düzeneklerden geliyor, değerlendirme kör değildi ve denemeler karıştırılmadı; bu yüzden kesin oranlara biraz şüpheyle yaklaşmak gerek. Yine de yönsel olarak rapor, frontier modellerin kaba manipülasyon için inandırıcı genel amaçlı robot beyinleri hâline geldiğine dair bir veri noktası; ince ayrıntılı yerleştirme ise herkes için çözülmemiş bir sorun olarak duruyor.
- #robotics
- #llms
- #benchmarks
- #openai
- #anthropic