· kaynak Hacker News – Front Page (hnrss.org)
Artificial Analysis Intelligence Index v4.2 daha zor agentic görevler ekliyor, doygun hale gelen GPQA Diamond'ı çıkarıyor
Artificial Analysis, Intelligence Index'ini v4.2'ye güncelledi; agentic bilgi işi ve uzun belge kıyaslamaları ekledi, özel saklı (held-out) test ağırlığını iki katına çıkarıp yüzde 40'a çıkardı ve doygun hale gelen GPQA Diamond'ı emekliye ayırdı.

Artificial Analysis, Intelligence Index'inin 4.2 sürümünü yayınladı; bu ara sürüm, yapay zekâ cephesindeki hızlı ilerlemelere yanıt olarak planlanan v5 güncellemesinin bazı parçalarını öne çekiyor. Şirket, yakın zamanda gerçekleşen büyük model lansmanları sırasında endeksi istikrarlı tutmak için değişiklikleri bilinçli olarak ertelediğini, ancak Ocak'ta yayınlanan v4'ten bu yana sekiz ay geçtiği için bir güncellemenin gerekli olduğuna karar verdiğini belirtiyor. Hacker News'in ana sayfasına ulaşan bir yazıda duyurulan revizyon, daha zor ve daha gerçekçi görevler ekliyor ve özel test setlerinden gelen puanlama payını iki katına çıkarıyor.
Yeni agentic ve belge kıyaslamaları
Öne çıkan eklemi AA-Briefcase: şirket içi, özel ve saklı (held-out) bir test seti üzerine kurulu bir agentic bilgi işi değerlendirmesi. Artificial Analysis'e göre modeller, sektör uzmanları tarafından tasarlanan ve her biri çok sayıda birbirine bağlı görev ile binlerce girdi kaynak dosyası içeren haftalarca süren projelerde test ediliyor. Puanlama, doğrulanabilir görev başarısını, analitik kaliteyi ve sunum kalitesini ölçmek için rubric ve pairwise değerlendirmeyi birleştiriyor; amaç, bir modelin izole sorular yerine sürekli bilgi işini ne kadar iyi yönettiğini yakalamak.
İkinci yeni kıyaslama olan GDP.pdf ise Surge AI tarafından oluşturuldu. On alandaki 100 PDF üzerinde tek turluk profesyonel belge akıl yürütme testi ediyor; modellerden 4.592 sayfalık metin, tablo, grafik, dipnot ve istisna üzerine yayılmış kanıtları sentezlemeleri isteniyor. Yanıtlar 1.275 uzman yazımı atomik kritere göre puanlanıyor ve başlık metriği olan All-pass Rate (Tam Geçme Oranı) bir göreve yalnızca tüm kriterler sağlandığında puan veriyor.
GPQA Diamond ise çıkarıldı. Artificial Analysis, artık doygun hale gelen — sınırdaki (frontier) modeller tarafından fiilen tavan yapıldığı için onları artık ayırt etmeyen — istisnai bir bilimsel akıl yürütme değerlendirmesi olduğunu söylüyor.
Oyunlaştırmaya (gaming) daha az alan
Endeksin ağırlıklarının yüzde 40'ı artık özel, saklı test setlerinden geliyor; bu v4.1'deki payın iki katı. Saklı veriler arasında AA-Briefcase, AA-Omniscience ve CritPt çözümleri yer alıyor. Belirtilen amaç, laboratuvarların değerlendirmeleri oyunlaştırma (gaming) yeteneğini azaltmak; çünkü herkese açık kıyaslamalar ister istemez eğitim verisine sızabiliyor. Artificial Analysis, saklı veri yüzdesinin v5'te yeniden yükseleceğini söylüyor.
Puanlama altyapısı güncellemeleri
Güncelleme yanıtların puanlanma biçimini de yeniden düzenliyor. AA-LCR v1.1 bir grading system prompt'u kazanıyor ve cevap anahtarlarındaki hata ile belirsizlikler düzeltiliyor. GDPval-AA v2 ve AA-Briefcase için örnekleme iyileştirildi ve Elo ölçeği yeni modeller eklendiğinde derecelendirmelerin istikrarlı kalması için yeniden sabitlendi. SciCode'un puanlama sandbox'ları daha sağlam hale getirildi, böylece yavaş ama doğru kod artık başarısız sayılmıyor.
Yeni liderlik tablosu ne gösteriyor
Anthropic'in Claude Fable 5.1'i artık endeksin lideri; onu GPT-5.6 Sol'ye göre 4 puan kazançla gelen OpenAI'nin GPT-6 Astra'sı izliyor. Meta üçüncü sıradaki laboratuvar; SpaceXAI, Moonshot/Kimi, Z.AI ve Google'ın önünde yer alıyor.
İki yeni kıyaslama alanı ikiye bölüyor. AA-Briefcase'te Claude Fable 5.1 ve Opus 5 önde; onları GPT-6 Astra ve Muse Spark 1.3 izliyor ve GPT-6 Astra, GPT-5.6 Sol'nün kabaca 85 Elo puan üzerinde. GDP.pdf'de ise OpenAI önde: GPT-6 Astra yüzde 33,2 All-pass Rate, GPT-5.6 Sol yüzde 28,2 ve Claude Fable 5.1 yüzde 26,2 elde ediyor.
Maliyet tarafında dört laboratuvar — Anthropic, OpenAI, Meta ve Z.AI — güncellenen Cost per Task Pareto sınırını paylaşıyor. Artificial Analysis'e göre GPT-6 Astra, zekâ sınırlarına yakın diğer neredeyse tüm modellerden daha token-verimli; Claude Fable 5.1, Grok 4.5 ve Gemini 3.5 Flash-Lite ise verimlilik eğrisinin uç noktalarında yer alıyor (endekste 25 puanın altında skor alan modeller hariç tutuluyor).
Neden önemli
Sınırdaki modeller herkese açık kıyaslamaları doyurdukça bu kıyaslamaların ayırt etme gücü azalıyor ve ödeme (benchmark gaming) artık liderlik tablolarından model seçen herkes için güncel bir kaygı. Artificial Analysis'ın özel, agentic, haftalarca süren görevlere yönelmesi, bir sonraki yararlı sinyalin gerçek işe benzeyen saklı değerlendirmelerden geleceğine dair bir iddia. Alıcılar için metodolojik değişim, sıralamalar kadar önemli: test bileşimi ve ağırlıklar değiştiği için puan hareketleri kısmen yeni metodolojiyi yansıtıyor ve AA-Briefcase ile GDP.pdf sonuçlarındaki ayrışma, hangi modelin en iyi olduğu sorusunun cevabının giderek göreve bağlı olduğunu gösteriyor. Daha fazla artımlı sürüm ve tam v5 önümüzdeki dönemde planlanıyor.
- #llm-benchmarks
- #ai-evaluation
- #artificial-analysis
- #frontier-models