· kaynak Hacker News – Front Page (hnrss.org)
GPT-6 Astra, CodeRabbit'ın erken incelemesinde dosyalar arası hataları %20'ye kadar daha fazla yakalıyor
CodeRabbit'ın erken değerlendirmesi, GPT-6 Astra'nın genel olarak GPT-5.6 Sol'dan %4, cross-file incelemelerde ise %20 daha fazla etiketli hata yakaladığını, token fiyatlarının ise 2,5 kat yüksek olduğunu ortaya koydu.

CodeRabbit neyi ölçtü
Hacker News'in ana sayfasına ulaşan bir değerlendirmede CodeRabbit, OpenAI'nin GPT-6 Astra'sını otomatik kod incelemesi için halihazırda kullandığı modellerle karşılaştırdı. Kullanılan metrik "eyleme dönüştürülebilir hata kapsamı": bir modelin, geliştiricinin gerçekten harekete geçebileceği bulgular aracılığıyla kaç etiketli hatayı ortaya çıkardığı.
Öne çıkan sayılar mütevazı. Astra, GPT-5.6 Sol'dan yaklaşık %4, Opus 5'ten %22 daha fazla etiketli hata yakaladı. CodeRabbit, genel farkın küçük olmasını, daha güçlü bir modelin öne çıkacak pek alan bulamadığı daha basit incelemeleri de içeren değerlendirme karışımına bağlıyor. Şirket, sonucu açıkça erken ve yön gösterici olarak nitelendiriyor.
Kazanımlar cross-file incelemelerde yoğunlaşıyor
Daha cesaret verici alt küme, daha zor olanı: bir değişikliğin tek başına bakıldığında doğru göründüğü ama kod tabanının başka bir yerinde bir şeyleri bozduğu cross-file incelemeler. Burada Astra'nın göreli üstünlüğü Sol'a karşı %20'ye, Opus 5'e karşı %33'e çıkıyor.
CodeRabbit'ın yorumu, Astra'nın temel ilerlemesinin, ilgili kanıt bir depoya dağılmış durumdayken doğru bilgi parçalarını birbirine bağlamada yattığı yönünde. Yazı, neden-sonuç ilişkisinde dikkatli: daha büyük bir context window'un tek başına performansı iyileştirdiğini, sonuçların genel inceleme kalitesini sıraladığını ya da aynı kazanımın her pull request'te görüneceğini iddia etmiyor.
Daha güçlü reasoning'in bedeli
Astra'nın yayımlanan standart API ücretleri, milyon input token başına 10 dolar ve milyon output token başına 50 dolar. Fable 5.1 de aynı temel ücretleri listeliyor, ancak cache fiyatları farklı. 100.000 cache'lenmemiş input token ve 10.000 faturalanabilir output token'lık (reasoning token'ları dahil) örnek bir görev kullanıldığında CodeRabbit, bu sabit kullanımda Astra'nın Sol'un 2,5 katı, Terra'nın yaklaşık 4,7 katı ve Luna'nın yaklaşık 47 katı maliyete sahip olduğunu hesaplıyor. Karşılaştırma; cache'leme, cache yazımları, araçlar, yeniden denemeler, bölgesel ek ücretler ve servis kademesi ayarlamalarını dışarıda bırakıyor; fiyatlar 4 Eylül 2026'da kontrol edildi ve Sol'un promosyonel fiyatlandırması en az 21 Kasım 2026'ya kadar sürüyor.
Bu kat sayılar, tamamlanan görev başına maliyetin tahmini değil. CodeRabbit, daha az token veya daha az deneme gerektiren bir modelin farkı kapatabileceği için OpenAI'nin kendi değerlendirmelerinde bazı durumlarda Astra için daha düşük tahmini görev maliyetleri raporladığına dikkat çekiyor. Pratik öneri, yalnızca token fiyatına veya bir yetenek benchmark'ına göre karar vermek yerine, kendi iş yükünüzde başarılı sonuç başına toplam maliyeti ölçmek. CodeRabbit ayrıca modeli müşteri ölçeğinde çalıştırmayı, fiyatlandırma değerlendirmesinin yanı sıra müşteri verisinin korunmasını gerektiren bir şey olarak çerçeveliyor.
Beceri nereye aktarılabilir
İncelemenin ötesinde CodeRabbit, aktarılabilir yeteneği ayrı kaynaklar arasındaki ilişkiler üzerinden reasoning yapmak olarak görüyor. Henüz ölçmediği aday kullanımları şöyle sıralıyor: çelişen araştırma raporlarını uzlaştırmak; gözlemleri hipotezlerden ayırırken log'lardan ve runbook'lardan olay açıklamaları oluşturmak; önerilen bir değişikliği spesifikasyonlar ve iç politikalar boyunca izlemek; ve bir rapor ile destekleyici dosyaları genelinde formüllerin, varsayımların ve anlatısal sonuçların uyuşup uyuşmadığını kontrol etmek. Ortak yapı, parçaları arasında bağımlılıklar bulunan dağınık kanıttır.
Stres testi olarak bütünüyle bir oyun
CodeRabbit ayrıca Astra'yı, Godot ve GDScript ile yazılmış bir action RPG olan NIGHTSHIFT'i geliştirmek için kullandı. Kapsam büyük: Path of Exile'dan ilham alan 988 düğümlü pasif yetenek ağacı, yedi karakter sınıfı, aktif yetenekler, rünler, yetenek evrimleri ve 10 perdede 40 bölge boyunca co-op oyunu. Ekip, en zor sorunun geliştirme ortasında çekirdek değişikliklerden sonra birbirine bağlı sistemleri yeniden dengelemek olduğunu, Astra'nın ise platform işlerini özerk biçimde hallettiğini söylüyor; bunlara yerel PS5 ve Xbox kontrolcü desteği, macOS, web ve Linux build'leri ile LAN co-op build'lerini dağıtmak için gereken Xcode projesi, sertifikalar ve notarizasyon dahil. Oyun, agent'ların kendilerinin de oynayabileceği şekilde de geliştirildi; Astra, canlı co-op oturumlarına takım arkadaşı olarak katılıyor.
Neden önemli
Kod incelemesi, daha iyi model reasoning'inin ölçülebilir ve paraya bağlanmış bir sonucunun görüldüğü ilk yerlerden biri: merge öncesi yakalanan hatalar ile inceleme başına faturalanan token'lar. CodeRabbit'ın sayıları, en yeni frontier modellerin primlerini esas olarak rutin kontrollerden ziyade zorlu, cross-file işlerde kazandığına işaret ediyor; bu da ekipleri, zor görevleri pahalı modellere yönlendirip kolayları ucuz seçeneklere bırakmaya götürüyor. Açık soru, görev başına verimliliğin token fiyatı primini dengeleyip dengeleyemeyeceği; yazı ise bunun yalnızca yeni modeli mevcut modelin yanında çalıştırıp kaliteyi, doğrulama süresini ve toplam maliyeti karşılaştırarak yanıtlanabileceğini savunuyor.
- #openai
- #code-review
- #llm
- #developer-tools
- #ai-pricing
İlgili yazılar
- OpenAI, 1,05 milyon token bağlam penceresine sahip GPT-6 Astra'yı yeni fiyatlandırma ve akıl yürütme kademeleriyle piyasaya sürdü
- OpenAI'nin GPT-6 Astra'sı agent işler için yayına girdi ve Kritik siber risk derecesi aldı
- OpenAI, agent sürüsünün Almanca wiki'yi ele geçirmesinin ardından yapay zeka olay bildirimi süreçlerini köklü şekilde değiştirecek