· kaynak Hacker News – Front Page (native)
Artificial Analysis, Gemini 4 Argon (High) modelini zekâ, maliyet ve token kullanımı açısından değerlendirdi
Artificial Analysis, Google'ın Gemini 4 Argon (High) modeline ait Intelligence Index ayrıntılarını yayımladı; değerlendirme agentic benchmark'ları, halüsinasyon skorlaması, token kullanımı ve görev başına fiyatlandırmayı kapsıyor. Sayfa Hacker News'te öne çıktı.
Artificial Analysis, Google'ın Gemini 4 Argon (High) modeline ait güncel bir zekâ, performans ve fiyat değerlendirmesi yayımladı; böylece geliştiriciler modelin yeteneklerini çalıştırma maliyetiyle karşılaştırabilecekleri tek bir referans noktasına kavuştu. 30 Eylül 2026 tarihli model sayfası, Hacker News'in ana sayfasında yer buldu.
Intelligence Index nasıl skorlanıyor
Merkezi unsur, on değerlendirmeyi tek bir sayıda toplayan Artificial Analysis Intelligence Index v4.3.2: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience ve AA-LCR v1.1. Artificial Analysis'a göre bu set, statik soru-cevaptan ziyade agentic çalışmaya ağırlık veriyor. Kapsam; agentic bilgi işi, agentic gerçek dünya iş görevleri, agentic kodlama ve terminal kullanımı, profesyonel belge akıl yürütme, terminalde yürütülen bilimsel araştırma iş akışları ve MLCR-AA etiketi altındaki tıbbi uzun bağlam akıl yürütmeden oluşuyor. İndeks ayrıca açık ağırlıklı modelleri tescilli modellerden ayrı grafiklendiriyor ve ticari kullanımı kısıtlayan lisansları işaretliyor. Ana skorun yanı sıra, yetenek endeksleri performansı belirli becerilere ve sektörlere göre dilimliyor; çünkü genel zekâ her kullanım senaryosuna eşit derecede tercüme olmuyor.
Agentic benchmark'lar ve Elo skorlaması
Artificial Analysis'ın kendisinin geliştirdiği agentic bilgi işi benchmark'ı AA-Briefcase v1.1, üç sinyali harmanlayan bir Elo değeri raporluyor: rubric geçme oranı, analitik kalite ve sunum kalitesi. Rubric sonuçları simüle edilmiş birebir karşılaştırmalar yoluyla Elo'ya dönüştürülüyor ve hem Elo değerleri hem de güven aralığı sınırları sıfırın altında kırpılıyor. Diğer değerlendirmeler — terminal tabanlı kodlamadan tıbbi içerik üzerinde uzun bağlam akıl yürütme kadar — tabloyu tamamlıyor.
Halüsinasyon ve kalibrasyon
AA-Omniscience bilgi güvenilirliğini ve halüsinasyonu ölçüyor. Doğru cevaplar skoru yukarı çekiyor, halüsinasyonlu cevaplar aşağı çekiyor, cevap vermeme ise herhangi bir ceza getirmiyor. Skorlar -100 ile 100 arasında değişiyor; sıfır, yanlış cevap sayısının doğru cevap sayısına eşit olduğu anlamına geliyor ve negatif skorlar yanlışların doğrulardan fazla olduğunu gösteriyor. Bu asimetri kasıtlı: kendini bilerek çekingen davranan modelleri cesaretle tahmin eden modellerden ayırıyor — bu ayrım, prodüksiyonda quiz tarzı bir testten çok daha fazla önem taşıyor.
Çalıştırmanın ekonomisi
Analizin fiyat tarafı, Intelligence Index görevi başına dolar cinsinden ağırlıklı ortalama maliyet olarak ifade ediliyor. On değerlendirmenin her biri için Artificial Analysis, modelin girdi, cache-hit, cache-write, reasoning ve cevap token fiyatlarını alıyor, görev sayısına bölüyor ve sonucu o benchmark'ın indeksteki payıyla ağırlıklandırıyor. Sayfa ayrıca setteki tüm değerlendirmeleri çalıştırmanın toplam maliyetini, görev başına tüketilen ağırlıklı ortalama çıktı token sayısını, önbelleğe alınmış prompt'lar, normal girdi ve çıktı arasında bölünmüş milyon token başına fiyatları ile bağlam penceresini — yani azami birleşik girdi ve çıktı token miktarını — raporluyor; çıktı tipik olarak bu sınırın epey altında tutuluyor. Önbelleğe alınmış prompt'lar genellikle normal girdiye kıyasla önemli bir indirimle sunuluyor; ancak cache-write ve cache-storage ücretleri ayrı faturalandırılıyor ve sağlayıcıya göre değişiyor. Daha büyük bağlam pencereleri esas olarak geniş belge kümeleri üzerinde akıl yürüten retrieval-augmented iş akışları için önem taşıyor.
Belirli indeks skorları ve dolar rakamları, bu metodolojinin yanında modelin analiz sayfasında yer alıyor; karşılaştırmayı modeller arasında tekrarlanabilir kılan da tam olarak bu.
Neden önemli
Bir frontier model seçmek artık bir yetenek kararı olduğu kadar birim ekonomi kararı. Fiyatı tamamlanan benchmark görevi başına maliyet olarak ifade etmek ve reasoning token'larını da hesaba katmak, ekiplere ucuz ama çok konuşan bir modelle pahalı ama verimli bir modeli eşit koşullarda karşılaştırma imkânı veriyor. Benchmark karması ayrıca değerlendirmenin nereye gittiğinin sinyalini veriyor: tek turluk bilgi sorularından değil, terminallerde, belgelerde ve araştırma iş akışlarında çok adımlı agentic çalışmaya doğru. Halüsinasyon cezası ile cevapsız bırakmaya tanınan hoşgörünün birleşimi ise kalibrasyonu ödüllendiriyor — prodüksiyon dağıtımlarının tam olarak ihtiyaç duyduğu şey bu. Yüksek hacimli uygulamalarda cache-hit, cache-write ve storage fiyatlandırması arasındaki ayrım, faturayı ana girdi ve çıktı oranlarından daha çok belirleyebiliyor; bu yüzden Google'ın caching koşulları, Gemini 4 Argon'un zekâ skoru kadar dikkatle incelenmeyi hak ediyor.
- #gemini
- #llm-benchmarks
- #artificial-analysis
- #ai
İlgili yazılar
- Google, güvenlik odaklı amiral gemisi Gemini 4 Argon'u duyurdu: Açıkları yamalamak için eğitildi
- Eski Google ve SpaceX çalışanı PM, Satlyt'in uyduda çalışan yapay zekâ yazılımı için 8 milyon dolar topladı
- Açık ağırlıklı Darwin-180B-RSI, sıfır hukuk eğitim verisiyle İsviçre hukuk sınavı kıyaslamalarında zirvede