deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Epoch AI'nin InnovationEval'ı: uç modeller yeni ML teknikleri icat etmekte zorlanıyor

Epoch AI'nin yeni InnovationEval benchmark'ı, bir yapay zekânın yakın tarihli bir post-training yeniliğini bağımsız olarak yeniden keşfedip edemeyeceğini soruyor. Uç modeller, binlerce dolarlık GPU zamanına rağmen çok az ilerleme kaydetti.

Epoch AI'nin InnovationEval'ı: uç modeller yeni ML teknikleri icat etmekte zorlanıyor

InnovationEval neyi ölçüyor

Epoch AI, bir yapay zekâ sisteminin, daha önce hiç görmediği, yakın zamanda insanlar tarafından geliştirilmiş bir yeniliğin performansına denk, yeni bir makine öğrenmesi tekniğini bağımsız olarak keşfedip keşfedemeyeceğini test eden InnovationEval benchmark'ının ilk sonuçlarını yayınladı. Şimdilik cevap pek olumlu değil: Epoch AI'ya göre, yakın zamanda çıkan uç modeller deneylere binlerce dolarlık GPU compute harcamasına izin verildiğinde bile bu görevde çok az ilerleme kaydediyor. Yayın, Hacker News'in ana sayfasında da yer aldı.

Bu eval'ın arkasındaki soru, klasik bir fikir üretme düşünce deneyinin somutlaştırılmış hali — 1905'e kadar insanlığın bilgisine sahip bir yapay zekâ özel göreliliği yeniden keşfedebilir mi? Epoch AI daha mütevazı bir varyant soruyor: Yapay zekâ araştırmacılarının 2026 başında bildikleri bilgiye sahip bir model, o zamandan beri insanların yayınladığı yeniliklere denk kendi algoritmik iyileştirmesini bulabilir mi? Bu çalışma, Crux Evals, ResearchGym ve RSI-Bench gibi diğer uçtan uca araştırma benchmark'larının yanında yer alıyor.

Görev ve puanlama yöntemi

Test ortamı, Epoch AI'nın yakın tarihli modeller tarafından benimsendiğini ve atıf aldığını söylediği bir post-training tekniği olan on-policy self-distillation (SDPO). Değerlendirilen agent, güçlü bir GRPO baseline'ını geçen yeni bir post-training yöntemi icat etmeli ve bunu kısa yanıtlı sorular ile kodlama üzerinde bir Qwen3-8B modelini fine-tune ederek göstermeli. Kendisinden, idealde orijinal, adı açıklanmayan yöntemin belirlediği referans değerlere ulaşan ya da onları aşan, alanı ileriye taşıyacak kadar ikna edici bir sonuç biçiminde kanıt üretmesi bekleniyor.

Puanlar, her biri orijinal makalenin deneylerinden alınan birkaç alt metrikten oluşan iki görev alanında ortalanarak hesaplanıyor. Bir alanda makalenin rakamlarına ulaşmak ya da onları geçmek %100, GRPO baseline düzeyinde performans göstermekse %0 puan getiriyor.

Gerçek özgünlüğü zorunlu kılmak

Epoch AI, mevcut yapay zekâ Ar-Ge değerlendirmelerinin çoğunun yenilik gerektirmeyen ya da bilinen teknikleri yeniden birleştirerek çözülebilen iyi tanımlanmış görevleri incelediğini savunuyor. InnovationEval, kapsam dahilindeki metrikleri belirgin biçimde iyileştirmek için modelin eğitim sırasında görmediği bir yöntem gerektirecek şekilde tasarlandı — ancak keşfedilen tekniğin SDPO'ya benzemesi gerekmiyor.

Bu kapsamı zorlamak hassas bir iş. Kısıtlanmadığı takdirde bir agent, sentetik fine-tuning verisi üretmek gibi kestirmelerle metrikleri şişirebilir; bu, benchmark rakamlarını yükseltir ama yeni bir post-training tekniği oluşturmaz. Bu nedenle Epoch AI, agent'ı loss ve güncellemelerini ya da sabit bir eğitim veri grubuna uygulanan rollout'lar ve model odaklı düzeltmelerle sınırlıyor. Kuruluş, bunun agent'ın sürekli açık ararken değerlendiricilerin de çözümleri sonradan geçersiz kılmasına yol açan bir dinamik doğurduğunu kabul ediyor; ancak kusurlu kapsam sınırlarının bile gönderimleri inceleme yükünü azalttığını söylüyor.

Bu turda puanlama tamamen otomatikleştirilemedi. Epoch AI, kapsam ihlallerini tespit etmek için otomatik bir hakem olan Opus 5 ile deney yaptı, ancak sonuçta her gönderimin sonuçlarına ve çalışma biçimine insanlı incelemeye dayandı. Her deneme ayrıca ciddi miktarda compute gerektiriyor; bu da değerlendirmeyi az sayıda çalıştayla sınırladı.

Veri kirliliği şimdiden sorun

Eval'ı gerçekten yayınlanmış bir yönteme dayandırmak görevin uygulanabilir olduğunu garanti eder ve gereken bütçeyi netleştirir; ama bu, yeni modellerin yöntemi ezberlemiş olabileceği anlamına da gelir. Epoch AI, projenin süresi içinde bunun yaşandığını söylüyor: Claude Fable 5 ve GPT-5.6 Sol, arama yapmadan tahmin etmeleri istendiğinde makalenin ayrıntılarını bildiklerine dair belirti göstermedi; ancak onların halefleri Claude Fable 5.1 ve GPT-6 Astra görevi zaten biliyordu. Gelecek turlarda ezberleme test edilecek, etkilenen sonuçlar işaretlenecek ve gerektiğinde yeni görevlerle değiştirilecek.

Neden önemli

Otomatik bir yapay zekâ araştırmacısı inşa etmek, önde gelen yapay zekâ geliştiricilerinin açık hedefi ve yapay zekâ, araştırma işinin parçalarında zaten yetkinliğini kanıtladı: yazılım mühendisliği görevleri, veri kümesi oluşturma ve tanımlı metriklerin açık uçlu optimizasyonu. InnovationEval, eksik kalan orta kısma odaklanıyor — fikirler üretme, uygulama, deneyleri çalıştırma, sonuçları analiz etme ve gerçekten yeni bir şeye kadar yineleme döngüsünün tamamı. Bu ölçekte, mevcut uç modeller yapay zekâ Ar-Ge'sinin kendisini otomatikleştirmekten hâlâ uzak. Bu, yapay zekânın kendi gelişimini ne zaman anlamlı biçimde hızlandırabileceğini tahmin eden herkes için faydalı, izlenebilir bir sinyal ve araştırma işinin şimdilik ne kadarının insanda kaldığına dair bir veri noktası. Epoch AI, zaman içindeki ilerlemeyi haritalamak için metodolojiyi genişletmeyi ve tekrarlamayı planlıyor.

  • #ai
  • #benchmarks
  • #machine-learning
  • #evaluation
  • #llms

İlgili yazılar