deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

GPT-5.6 Luna vs GPT-6 Astra: 0,004 dolarlık bir inceleme, 0,11 dolarlık incelemenin bulduklarının %75'ini yakalıyor

Entelligence, GPT-5.6 Luna ve GPT-6 Astra'yı 50 hatalı pull request üzerinde test etti. Luna, doğrulanmış hataların %75'ini maliyetin %3,6'sına yakaladı; ancak çoğu güvenlik sorununu kaçırdı ve çok daha fazla yanlış bulgu üretti.

GPT-5.6 Luna vs GPT-6 Astra: 0,004 dolarlık bir inceleme, 0,11 dolarlık incelemenin bulduklarının %75'ini yakalıyor

Hacker News ana sayfasında şu anda dolaşan Entelligence'ın benchmark'ı, birçok mühendislik ekibinin artık karşılaştığı bir soruya somut sayılar koyuyor: en ucuz frontier model pull request incelemesi için yeterli mi? Kasıtlı olarak hatalandırılmış 50 PR genelinde GPT-5.6 Luna ile yapılan tek bir inceleme 0,0041 dolar, GPT-6 Astra ise 0,113 dolar tuttu — inceleme başına 28 kat fark — buna rağmen Luna, çok daha pahalı kardeşinin yakaladığı doğrulanmış hataların dörtte üçünü yakaladı.

Test nasıl yapıldı

Entelligence, AI-Code-Review-Evals organizasyonundan 50 herkese açık benchmark pull request kullandı: Cal.com, Sentry, Discourse, Keycloak ve Grafana'dan onar tane, temel branch'lere karşı kasıtlı olarak yerleştirilmiş hatalarla. Her iki modele aynı diff'ler üzerinde aynı prompt verildi; doğruluk, güvenlik, eşzamanlılık (concurrency), kaynak ve hata işleme sorunları istenirken stil, isimlendirme, dokümantasyon ve test önerileri hariç tutuldu.

Doğrulama sürecinde Astra, Luna, GPT-5.6 Sol ve herkese açık Entelligence incelemeci yorumlarından gelen bulgular tek bir anonim listede birleştirildi; bu listeyi Astra ve Sol bağımsız olarak değerlendirdi. Bir bulgu, yalnızca iki hakem de gerçek diye nitelendirdiğinde doğrulanmış sayılıyor. Bulguların %91'i üzerinde anlaştılar ve 143 ayrı hata her ikisini de geçti. Fiyatlandırmada Luna, milyon input token başına 0,20 dolar ve milyon output token başına 1,20 dolar alıyor; Astra ise 10 ve 50 dolar alıyor.

Öne çıkan sayılar

  • Doğrulanmış hata: Luna için 69, Astra için 92
  • Toplam ortaya çıkarılan bulgu: 93'e karşı 96
  • Hassasiyet (precision): %74'e karşı %96 — Luna'nın 24 bulgusu, Astra'nın 4 bulgusu doğrulamadan geçemedi
  • 50 PR genelinde toplam maliyet: 0,20 dolara karşı 5,66 dolar
  • Doğrulanmış hata başına maliyet: 0,0030 dolara karşı 0,061 dolar
  • Ortalama inceleme süresi: 23 saniyeye karşı 36 saniye

Luna inceleme başına yaklaşık 3,1 kat daha fazla output token üretti (2.104'e karşı 688) ve yine de çok daha ucuz kaldı; çünkü output fiyatı 42 kat daha düşük. Entelligence'a göre çıkarım şu: Luna o fiyata günlük doğruluk hataları için yeterli, ancak yazarlar ona tek başına kimlik doğrulama veya yetkilendirme kodunda güvenmezdi.

Ucuz modelin çöktüğü yerler

Genel skor, depo başına büyük farkları gizliyor. Sentry, Discourse ve Grafana'da Luna, Astra'nın iki doğrulanmış hatası kadar yaklaştı. Cal.com'da fark daha büyüktü: 21'e 30. Kimlik ve erişim yönetimi sunucusu olan Keycloak en kötüsüydü: Luna 6 doğrulanmış hata bulurken Astra 14 buldu ve Keycloak bulgularının yalnızca yarısı doğrulamadan geçebildi; Astra'da bu oran %93'tü.

Hata sınıfı dağılımı da aynı yönü gösteriyor. Luna, Astra'nın 47'sine karşı 39 veri ve mantık hatası, 13 eşzamanlılık hatasının 10'unu buldu. Güvenlikte Astra'nın 19 bulduğunun karşısında 24'ün 9'unu bulabildi. İki Keycloak örneği farkı netleştiriyor: yeniden kullanıma izin veren, hiç 'kullanıldı' olarak işaretlenmeyen federe kurtarma kodları ve tek tek istemcilerde ayarlanan reddedilmeleri sessizce geçersiz kılan global görüntüleme yetkisi. İkisi de tek bir satırda görünmüyor — fark edilmeleri için değişiklikten sonra yetki modelinin neye izin verdiğinin çözülmesi gerekiyor.

Luna, Astra'nın kaçırdıklarını da yakaladı. 143 doğrulanmış hatanın 44'ü iki modelden, 48'i yalnızca Astra'dan, 25'i yalnızca Luna'dan geldi; çoğunlukla veri ve mantık ya da eşzamanlılık sorunlarıydı. Her PR'da iki modeli çalıştırmak 117 hatayı, yani %82'yi, toplam 5,86 dolara ortaya çıkarırdı — Astra'nın 5,66 dolarının üzerine Luna'nın 0,20 doları, 25 ek doğrulanmış bulgu satın alıyor.

Yazarların belirttiği uyarılar

  • Her model, on PR üzerinde küçük bir tekrar testi dışında her PR'yı bir kez inceledi. Astra, 15 doğrulanmış hatasının 10'unu her iki tekrarda da buldu; Luna 15'in 7'sini buldu. Bu yüzden tek çalıştırma rakamları özellikle Luna için kabaca kabul edilmeli.
  • Astra hem yarışmacı hem de iki hakemden biri; Entelligence bunun, Sol'un da onayı gerekse bile sonuçları hafifçe lehine çevirebileceğini kabul ediyor.
  • Benchmark PR'ları 2013'ten 25 Temmuz 2025'e kadar tarihlendiriliyor; ikisinin de eğitim kesim tarihinden önce oldukları için okuyucuların istediği tarih-bölmesi kirlilik testi burada mümkün değil. Hatalar özellikle benchmark için eklendi, ancak doğru upstream koda aşina modeller yine de avantajlı olabilir.
  • Her iki model de yalnızca diff'i gördü — depo geçmişi, çağrı grafiği (call graph) veya üretim verisi yok.
  • En az 26 doğrulanmış hata yalnızca Sol veya Entelligence incelemecisi tarafından yakalandı; yani karşılaştırılan iki model de gerçek sorunları kaçırıyor ve fark edilmeyen hatalar havuza hiç girmediği için gerçek sayı daha yüksek.

Neden önemli

Bu, model seçimi ekonomisi için alışılmadık derecede eyleme dönüştürülebilir bir veri. İnceleme başına 28 kat ve doğrulanmış hata başına 20 kat fark, ekiplere yönlendirme için somut bir temel veriyor: rutin doğruluk kontrolleri için ucuz modeller, kimlik doğrulama veya yetkilendirmeye dokunan her şey için premium modeller ya da ikisi birlikte — burada PR başına kabaca 0,004 dolar 25 ek bulgu satın alıyor. Hassasiyet bedeli madalyonun öteki yüzü — her dört yorumdan biri yanlış olduğunda geliştiriciler hızlıca göz gezdirmeyi öğreniyor ve bu, tüm inceleme hattına olan güveni aşındırıyor. Benchmark ayrıca yalnızız diff tabanlı incelemenin tavanını gösteriyor: her model, yalnızca daha geniş bağlamla ortaya çıkan hataları kaçırdı.

  • #ai
  • #code-review
  • #llm
  • #benchmarks
  • #developer-tools

İlgili yazılar