· kaynak dev.to (home feed)
IDKMesh deneyi: 25 doğrulayıcılı panel etkin büyüklükte 1.00 olarak ölçüldü
Açık kaynak bir deney, 25 program doğrulayıcısının hatalarının o kadar korelasyonlu olduğunu buldu ki panelin çoğunluğu tek bir üyesinden daha iyi performans göstermedi; bunun istiflenmiş LLM kod inceleyicileri için sonuçları var.

Açık kaynak bir araştırma projesi, yapay zekâ destekli kod incelemesinin arkasındaki temel bir varsayımı sorgulayan bir ölçüm yayımladı: bir gate'e eklenecek doğrulayıcı sayısını artırmanın orantılı biçimde daha fazla güven sağladığı varsayımı. Projenin baş deneyinde, 25 program tabanlı doğrulayıcıdan oluşan bir panel, üyelerinden tek bir tanesinden daha iyi performans göstermedi; çünkü hatalarının ağır biçimde korelasyonlu olduğu ortaya çıktı.
IDKMesh adlı proje, yazarı tarafından bir dev.to gönderisinde Apache-2.0 lisanslı, Python 3.11 ve üzeri için geliştirilen, insanların, yapay zekâ ajanlarının, araçların ve heterojen hesaplamanın belirsiz hedeflerde nasıl koordine olabileceğini inceleyen bir araştırma çabası olarak tanımlanıyor. Tek cümlelik tezi şu: inceleyici sayısı, bağımsız kanıt sayısı değildir. Bunu sınanabilir kılmak için proje, bir ekibin zaten topladığı karar kayıtlarını alan ve panelin gerçekte ne kadar değerli olduğunu raporlayan bir gate-audit komutuyla geliyor. Paket içindeki örnek açıkça sentetik olarak etiketlenmiş; beş uydurma inceleyici 1.69'luk etkin oy sayısı üretiyor, böylece aritmetiğin gösterimleri hiçbir zaman ölçümle karıştırılmıyor.
Deney nasıl çalıştı
Gözlemlenen sonuç, hiçbir dil modeli kullanmayan E017 deneyinden geliyor. 25 doğrulayıcının her biri küçük bir program: bir problemin giriş alanının adlandırılmış bir bölgesinden (tiny, small, large, extreme veya duplicate) girdi çeken ve bir adayı yalnızca tüm bu girdilerde bir referans uygulamayla eşleşiyorsa kabul eden kısmi bir test orak'ı. Beş bölge ile beş seed'in çaprazlanması 25 doğrulayıcıyı üretti; bunlar, doğru değerleri gizli testleri çalıştırarak belirlenen 72 adaylık bir külliyat üzerinde koşturuldu.
Tek tek ele alındığında doğrulayıcılar sağlamdı. Her biri Bonferroni düzeltmesinden sonra anlamlı biçimde pozitif bir Youden J istatistiği gösterdi; ortalama doğruluk 0.7956 idi. Sorun, hatalarının birbiriyle nasıl hizalandığında ortaya çıktı.
Denetim ne buldu
Aynı giriş bölgesinden alınan doğrulayıcılar hatalarını ortalama +0.8924 korelasyonla paylaştı; bu bir bağımlılığı proje zaten bildirmişti. Çarpıcı sayı başka yerdeydi: tasarım gereği bağımsız ilan edilen, farklı bölgelerden doğrulayıcılar bile hatalarını ortalama +0.5263 korelasyonla paylaştı. Tüm çiftler genelinde figür +0.5873 idi. Başka bir deyişle, doğrulayıcıların kağıt üzerinde nasıl gruplandığı, başarısızlıklarının gerçekte bağımsız olup olmadığı hakkında pek az şey söylüyor.
Sonuç alt satırda kendini gösterdi. 25 doğrulayıcılı çoğunluk 0.2083 hata oranı yayımladı; bu, 0.2044 ile tek bir doğrulayıcıdan marjinal biçimde kötüydü. Panelin ölçülen etkin büyüklüğü, 25 nominal oydan 1.00'di. Standart korelasyon sezgüsel yöntemi 1.66 tahmin etti ve panelin değerini 1.66 kat abarttı. Gönderiye göre ölçümün tamamı tek bir dizüstü bilgisayarda yaklaşık beş saniyede koştu.
Alışılmış düzeltme neden kurtaramıyor
Bilinen çözüm, N_eff = N / (1 + (N-1)rho) formülünü kullanarak korelasyon için iskonto yapmaktır. Yoldaş deney E015, bu formülü bir parametre ızgarasında sınadı ve formülün 0 ve 1 koreasyonlarında tam, arada yanlış, hatasının yönünde ise tutarsız olduğunu buldu. Doğrulayıcıların zayıf olduğu yerde muhafazakâr tarafta hata yapıyor; ama doğrulayıcıların isabetli ve mütevazı bağımlılık paylaştığı yerde iyimser tarafta hata yapıyor — bu da tam olarak ekiplerin önem verdiği rejim. 0.90 doğruluk ve 0.125 korelasyonda, ölçülen etkin büyüklük sezgüsel yöntemin 8.00 asimptotuna karşı 4.60'ta doyuyor. Gerçekten bağımsız bir 9 doğrulayıcılı panelin 0.000891 dengeli hataya ulaşacağı yerde, gerçek panel 0.0125 verdi — on dört kat daha kötü.
Çalışma ne iddia etmiyor
Gönderi kapsam konusunda açık. Hiçbir yapay zekâ inceleme paneli ölçülmedi: E017'nin doğrulayıcıları programlardır ve LLM inceleyicilerinin aynı korelasyon yapısını gösterip göstermediği açık bir soru olarak tanımlanıyor — yazarın en çok veri istediği soru da bu. IDKMesh, üretim yazılımı değil bir araştırma önizlemesidir, henüz PyPI'da yoktur ve bir repository klonundan kurulması gerekir. Yazar, ister insan inceleyiciler, ister LLM hakemler, ister CI kontrollerinden gelsin, gerçek bir inceleme gate'inden karar kayıtlarına sahip herkesi, özellikle sonuçlar ters düşüyorsa, bunlar üzerinde gate-audit koşturmaya davet ediyor.
Neden önemli
Ekipler, ucuz kod üretimine giderek artan biçimde inceleyici istifleyerek yanıt veriyor: bir pull request üzerinde birkaç LLM hakem, gate'te daha fazla kontrol. Bu sonuç, o istiflemenin arkasındaki aritmetiğin şüpheyi hak ettiğini öne sürüyor. LLM inceleyicileri çakışan eğitim verisi, benzer prompt'lar veya ortak araçlar aracılığıyla kör noktalar paylaşıyorsa, büyük bir panel yirmi beş gibi görünürken tek bir inceleyicinin etkin güvenini teslim edebilir. Pratik hamle, panellerin bağımsızlığını varsaymak yerine onları ölçmektir — ve bu çalışma, standart korelasyon iskontosunun tam olarak isabetli ve mütevazı biçimde bağımlı doğrulayıcıların bulunduğu yerde en az güvenilir olduğunu savunuyor. Kontrol etmenin maliyeti düşük: denetimin kendisi saniyeler içinde koşuyor.
- #code-review
- #llms
- #open-source
- #verification
- #statistics