· kaynak dev.to (home feed)
Ucuz LLM kod inceleyicileri rutin hatalarda ayakta kalıyor ancak yetkilendirme açıklarında çöküyor
Bir satıcının 50 açık kaynak pull request üzerinde yaptığı kıyaslama, bütçe dostu bir LLM'in günlük hatalarda sınır modeline neredeyse yetiştiğini ama 24 güvenlik açığından yalnızca 9'unu yakaladığını ortaya koydu; en kötü performans Keycloak izin kodlarında görüldü.

Yapay zekâ destekli kod inceleme modellerinin satıcı tarafından yürütülen bir karşılaştırması son derece pratik bir sonuç ortaya koydu: bütçe dostu bir model, günlük doğruluk hatalarında sınır modeline neredeyse yetişti, ancak güvenlik açıklarının çoğunu kaçırdı; en kötü performans ise kimlik doğrulama ve izinleri işleyen kodlarda görüldü.
Cole Halton'ın dev.to'daki yazısına göre değerlendirme, beş açık kaynak kod tabanından alınan 50 herkese açık kıyaslama pull request'ini kapsıyordu: Cal.com, Sentry, Discourse, Keycloak ve Grafana. Tessa Insley'in ikinci bir dev.to analizinde bu karşılaştırmayı 14 Eylül 2026 tarihli olarak Entelligence'e atfediyor ve iki modeli GPT-5.6 Luna ile GPT-6 Astra olarak adlandırıyor.
Rakamlar ne gösteriyor
Maliyet tarafında ucuz model yenilmez görünüyor. Luna 69 hatayı toplam 0,20 dolar harcayarak doğrularken, Astra 92 hatayı 5,66 dolara doğruladı; bu da doğrulanmış başına hataya kabaca 0,003 dolara karşı 0,061 dolar demek. Insley, inceleme başına maliyetleri Luna için 0,0041 dolar, Astra için 0,113 dolar olarak veriyor.
Rutin kusurlarda fark neredeyse kayboluyor. Halton, Luna'nın Astra'nın 47'sine karşılık 39 doğrulanmış veri ve mantık hatası, 13'üne karşılık 10 eşzamanlılık hatası bulduğunu bildiriyor. Insley, Sentry, Discourse ve Grafana'da Luna'nın Astra'nın iki doğrulanmış hatası içinde kaldığını, farkın ise Cal.com'da 21'e karşı 30 ile açıldığını ekliyor.
Güvenlik ise bu kalıbın bozulduğu alan. Luna kıyaslamadaki 24 güvenlik hatasının 9'unu yakaladı; Astra 19'unu yakaladı. Kimlik ve erişim yönetimi sunucusu olan Keycloak'ta Luna, Astra'nın 14'üne karşılık 6 doğrulanmış bulgu üretti ve bulgularının yalnızca yaklaşık yarısı doğrulamadan sağlam çıkabildi; Astra'da bu oran yüzde 93'tü.
Kaçırılan hatalar
Astra'nın yakalayıp Luna'nın kaçırdığı iki Keycloak hatası, bu başarısızlık modunu gözler önüne seriyor. Birinde, federe kurtarma kodları hiçbir zaman kullanıldı olarak işaretlenmiyordu, dolayısıyla bir kod sonsuza dek yeniden kullanılabiliyordu. Diğerinde, yeni eklenen global görüntüleme izni, tek tek istemcilerde yapılandırılan reddedilmeleri sessizce geçersiz kılıyordu.
İki hata da tek bir satırda görünmüyor. Bunları fark etmek, değişiklikten sonra izin modelinin bütününü akıl yürütmeyi gerektiriyor. Halton ve Insley, yerel kusurları tarayan küçük bir modelin bu hata sınıfına yapısal olarak kör olduğunu savunuyor.
Gürültü ve kararsızlık
Hassasiyet ikinci bir maliyet ekliyor. Luna'nın bulgularının yaklaşık dörtte biri, 93 bulgudan 24'ü yanlıştı; Astra'da bu 96 bulgudan 4'tü; yani yüzde 74 hassasiyete karşı yüzde 96. Halton'ın uyarısı şu: yanlış pozitifler güveni aşındırıyor. Yapay zekâ yorumlarının dörtte birinin gürültü olduğunu gören inceleyiciler bunları okumamaya başlıyor ve o noktada gerçek yakalamalar da artık yerine ulaşmıyor.
Insley, satıcının yürüttüğü tekrarlanabilirlik kontrolüne dikkat çekiyor: kod tabanı başına iki pull request ikinci ve üçüncü kez yeniden çalıştırılmış. Bu on pull request'te Luna ilk turda 15 doğrulanmış hata kaydetti, ancak yalnızca 7'si her iki tekrarda, 12'si en az bir tekrarda yeniden ortaya çıktı; Astra'nın rakamları 15, 10 ve 14'tü. Örneklem küçük, ama bir modelin bir çalıştırmada hatayı bulup bir sonrakinde kaçırabileceğini gösteriyor; tek çalıştırmalık kıyaslama puanlarının gizlediği tam da bu değişkenlik.
Kıyaslama üzerine uyarılar
İki yazar da aynı zayıflıklara işaret ediyor. Astra, bulguları doğrulayan iki hakimden biri olarak görev yaptı, dolayısıyla kendi çıktısına lehte not vermiş olabilir. Ayrıca kıyaslamanın tüm pull request'leri her iki modelin eğitim kesim tarihlerinden önceye denk geliyor: Insley, yerleştirilen kusurların yeni olduğunu, ancak çevresindeki kodun herkese açık ve eski olduğunu, commit tarihlerinin 2013'e kadar geri gittiğini belirtiyor; bu da modellerin bu dosyaların doğru sürümlerini fiilen görmüş olabileceği anlamına geliyor. Mutlak büyüklüklere şüpheyle yaklaşmak gerekir; ayakta kalan şey sonuçların biçimidir.
Neden önemli
Yapay zekâ inceleyicileri benimseyen ekipler için çıkarım, ikame değil yönlendirme. Ucuz bir model, günlük değişiklikler için makul bir triyaj katmanı ve harcamayı ciddi şekilde sınırlıyor. Ancak yetkilendirme, kimlik doğrulama veya izin mantığına dokunan kod daha güçlü bir inceleyici gerektiriyor ve hangi model üretmiş olursa olsun, çıktısı yakın insan ilgisi istiyor. Kıyaslama ayrıca satıcılardan daha fazlasını talep etmenin gerekçesini oluşturuyor: hata sınıfına ve kod tabanına göre kırılımlar, tekrarlanabilirlik verileri ve kıyaslama kodunun eğitim verisinden önceye ait olup olmadığının açıklanması. Toplu bir puan, en aşağıda en pahalıya patlayan başarısızlık modunu, yani kaçırılmış bir izin bypass'ını tam olarak gizliyor.
- #ai
- #code-review
- #llm
- #security
- #open-source
İlgili yazılar
- GPT-5.6 Luna vs GPT-6 Astra: 0,004 dolarlık bir inceleme, 0,11 dolarlık incelemenin bulduklarının %75'ini yakalıyor
- CopilotKit'in OpenBot'u yapay zeka ajanlarını policy gateway arkasındaki izole container'larda çalıştırıyor
- Makale, yapay zekanın ürettiği kodu kendi kendine incelemesini yapısal olarak zayıf kılan iki boşluğu çerçeveliyor