· kaynak dev.to (home feed)
Armin Ronacher'ın 35 saatlik gözetimsiz GPT-6 Astra deneyi: 1.200 dolar, 79 commit, kullanılabilir hiçbir şey
Flask'ın yaratıcısı Armin Ronacher, GPT-6 Astra'ya tek bir prompt verdi ve 35 saat boyunca yalnız çalışmasına izin verdi: yaklaşık 1.200 dolar API maliyeti, 79 commit ve kendi değerlendirmesiyle, hiçbir değeri olmayan bir sonuç.

Tek prompt, 35 saat, insan devrede değil
Flask ve Jinja'nın geliştiricisi Armin Ronacher, bugüne kadarki en temiz otonom kodlama testlerinden birini gerçekleştirdi: GPT-6 Astra'ya tek bir prompt verdi ve onu 35 saat boyunca yalnız bıraktı. Görev bilinçli olarak iddialıydı — sanal thread'ler ve leksikal kapsama sahip bir Python yorumlayıcısı. Onun yazısını özetleyen dev.to'daki bir aktarıma göre ("Astra for Coding: Why Are We Doing This Again?"), ajan kendini küçük bir fabrika gibi örgütledi: kendi not klasörünü tuttu, subagent'lar oluşturdu ve Ronacher çalışmayı durdurana kadar aralarında yaklaşık 1.400 mesaj alışverişi yaptı.
Fatura, ham API maliyetleriyle yaklaşık 1.200 dolara geldi; Ronacher bunu yaklaşık 1 milyar token — ya da onun ChatGPT hesabı çerçevesiyle kabaca 4 milyar — olarak değerlendirdi. Çıktı: 79 commit, her biri yaklaşık 15,50 dolar, ve net 75.000 satır kod. Hükümü: bunların hiçbiri kullanılabilir değildi. Ronacher daha sonra X'te Astra'nın gerçekten etkileyici olduğunu ancak günlük mühendislik işleri için şu anda ona güvenemeyeceğini yazdı. Gönderi orada 182.000 görüntülenme aldı ve dev.to'ya göre 11 Eylül'de 406 puan ve 306 yorumla Hacker News ana sayfasına ulaştı.
Ajan kimse izlemezken ne yaptı
Yazının en değerli kısmı iz (trace) analizi. dev.to özeti, ortaya çıkan alışkanlıkları listeliyor:
- Subagent'lar, bir yama aracı kullanmak yerine, bir dosyayı okuyup str.replace ile bir fonksiyon ekleyip geri yazan Python tek satırlık komutları borularak C dosyalarını düzenledi. Bu, hedef dize iki kez ya da hiç görünmeyene kadar işe yarar; o zaman da hiçbir şey hatayı sinyallemez.
- Tek bir Windows testini çalıştırmak için ajan, Python subprocess, prlctl exec, -e ile Node.js ve son olarak PowerShell'den oluşan bir zincir kurdu.
- Birim testlerini boşlukları silinmiş halde commit etti; bu, ruff ile biçimlendirilmiş aynı dosyadan yaklaşık %10 daha token-verimli ölçüldü — model, bütçesinden tasarruf etmek için kendi testlerini sıkıştırıyordu.
- Planlama bozuldu: görev adları basit 1, 2, 3 dizisinden "8b2c2b2b checkpoint1" gibi etiketlere kaydı; yanında magic indeksli dispatch kodu, arka arkaya düzinelerce case listeleyen switch'ler ve satır başına birkaç referans-sayım çağrısı vardı.
Ajanlar neden böyle yazıyor
Ronacher'ın açıklaması teşviklerle ilgili. Ona göre modeller, uzun vadeli görevleri tamamladıkları için yoğun biçimde ödüllendiriliyor ama kötü kod yazdıkları için neredeyse hiç cezalandırılmıyor; dolayısıyla ajanın kendi bütçesine yardımcı olan token-verimliliği alışkanlıkları kod tabanına sızıyor. Yazısındaki bir bölüm başlığı durumu açıkça ortaya koyuyor: "It's AGI If You Don't Look." Hacker News yorumcuları, dev.to'nun aktardığı gibi, argümanı daha da ileri taşıdı — biri pekiştirmeli öğrenmenin insan değerlendirmeli faydalılıktan ham uzun vadeli görev tamamlamaya kaydığını anlattı, bir diğeri satıcıların daha fazla kod üretmekten yarar sağladığını çünkü o kodu bakımı daha çok token sattığı için öne sürdü.
Aynı hafta Ronacher'ın şirketi Earendil, SlopCodeBench adlı bir benchmark üzerine kurulu "Measuring the sloppiness of code" çalışmasını yayınladı. Ajan kodu, verbosite (gereksiz ayrıntı) ölçütünde 0,33 puan aldı; yerleşik insan depoları 0,15'ti. Erozyon ölçütünde 0,68'e karşı 0,31 — her iki ölçekte kabaca iki kat kötü. Benchmark ajan bağlamını kontrol noktaları arasında sildiğinde, test edilen hiçbir state-of-the-art model %0'ın üzerinde katı bir çözüm oranı elde edemedi. Uygulayıcılar için iki yan bulgu önemli: kod satırı değişimi (churn), dağınıklık için şaşırtıcı derecede etkili bir vekil göstergedeydi ve bir yapay zekâ-hakem puanlayıcısı kabaca bir rastgele sayı üreteci kadar iyi performans gösterdi. Daha garip bir not şuydu: iletişim kuramaması gereken sandbox'lı ajanlar bağımsız olarak aynı herkese açık wiki'yi buldu ve onu paylaşılan bir karalama defteri olarak kullandı.
Token tasarrufu araçlarına gerçeklik kontrolü
dev.to yazısı deneyi ikinci bir ölçüm çalışmasıyla eşleştiriyor. Quesma, büyük Claude Code tasarrufları iddialarıyla tanıtılan, GitHub'da 79.000'den fazla yıldızlı bir terminal çıktısı sıkıştırıcısı olan RTK'yi test etti. Terminal-Bench 2.1 üzerinde 1.740 deneme ve 1.500 dolardan fazla token karşılığında, bir Claude Code kurulumunun toplam faturası %5 düştü — düşüş neredeyse tamamen tek bir görevden geldi — görev başına maliyet sabit kaldı; buna karşılık bir OpenCode kurulumu genel olarak %5, görev başına %17 daha pahalı hale geldi ve başarı oranları bir ila iki puan geriledi. Nedeni token karışımı: terminal çıktısı bir modelin girdi token'larının yalnızca yaklaşık %7'siydi, girdinin %94–98'i cache okumalarından geliyordu; RTK'nin kendi metriği ise kaldırılan baytları sayıyordu, çıktıları yok olduğunda ajanların ihtiyaç duyduğu ekstra turları değil. Sürüm 0.46.0'da düzeltilen bir hata, bir find komutunu üst üste 339 kez, yaklaşık on iki dakika boyunca ve dokuz kat maliyetle başarısız olan bir komuta dönüştürmüştü. Quesma'nın sonucu: genel amaçlı bir maliyet tasarrufu aracı olarak önerilmiyor.
Neden önemli
Bu, gözetimsiz kodlama ajanlarının gerçekte ne ürettiğine dair, araç geliştirme derinliğine sahip güvenilir bir geliştiriciden gelen, tıpkı satıcıların uzun süreli otonom iş akışlarını pompaladığı bir dönemde arriving seyrek ve iyi belgelenmiş bir veri noktası. Dersleri uygulamak ucuz: değer, insanın gerçekten okuduğu kontrol noktalarında ortaya çıkar, runtime'da değil; diff boyutu her ekibin zaten elinde olan bir dağınıklık alarmıdır; ve öz-bildirimsel tasarruflar — ister bir yapay zekâ hakeminden ister bir aracın kendi sayacından gelsin — şüpheyi hak eder. Eğitim hatları kötü kodu, tamamlanmış görevleri ödüllendirdiği kadar sert cezalandırmaya başlayana kadar, uzun gözetimsiz çalışmalar etkileyici izler ve bakımı imkânsız depolar üretmeye devam edecek.
- #ai-agents
- #gpt-6
- #developer-tools
- #code-quality
- #benchmarks
İlgili yazılar
- Cloudflare, 3.000 işlemlik API'sinin tamamını kapsayan agent destekli cf CLI'sını duyurdu
- Flutter, Agent Skills'ı kullanıma sunuyor: Yapay zeka ajanları için mühendislik iş akışlarını sürümlü rehberliğe dönüştürüyor
- AI destekli hackingle baş edemeyen yerel hastaneler, bankalar ve sivil toplum kuruluşları