deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Fields Madalyalıları benchmark yarışının matematiğe zarar verdiğini uyarır; Nvidia IMO altın tarifini açtı

Yirmi beş Fields Madalyası sahibi, benchmark odaklı yapay zekâ problem çözme çabalarının matematiğe zarar verdiğini uyarırken, Nvidia aynı hafta IMO altın madalyalı sistemünün tam tarifini yayımladı.

Fields Madalyalıları benchmark yarışının matematiğe zarar verdiğini uyarır; Nvidia IMO altın tarifini açtı

Yirmi beş Fields Madalyası sahibi, 11 Eylül 2026'da yapay zekâ şirketlerinin benchmark itibarı kazanmak uğruna matematik problemlerini çözmeye yönelik yarışının disiplinin kendisine zarar verdiği konusunda uyarıda bulundu. mathandai.org adresinde "A Severe Misalignment of AI in Mathematics" başlığıyla yayımlanan ortak bildirileri, OpenAI'nin 90 yıllık bir problemi çözdüğünü iddia ettiği ve Nvidia'nın altın madalyalı olimpiyat sisteminin tamamen açık bir tarifini paylaştığı bir haftayı tamamladı.

Fields Madalyalıları ne söyledi, ne söylemedi

İmzacılar yapay zekânın yeteneğini tartışmıyor. Bildirinin girişine göre, büyük dil modellerinin çeşitli alanlarda önemli açık problemleri çözebilecek düzeye ulaştığını kabul ediyorlar. İtiraz ettikleri şey süreç: Cevaplar sık sık aceleyle açıklanıyor ve düzgün bir yazım, yeni yöntem ve fikirlerin çıkarılması ya da önceki çalışmaların kaynak gösterilmesi için zaman bırakılmıyor. Bildiri, bunun atıf ve intihal konusunda ciddi sorular ortaya çıkardığını söylüyor.

Daha derindeki argüman matematiğin bilgiyi nasıl ürettiğiyle ilgili. Bildiride açıklandığı üzere, dönüm noktası niteliğindeki açık problemler insan anlayışının ulaştığı yeri işaret eder ve bir çözüm, ancak başkalarının üzerine inşa edebileceği fikirler ürettiği ölçüde önemlidir. Doğru bir cevabı aktarılabilir bilgiye dönüştürmek, topluluğun sindirim sürecini gerektirir — dersler, tartışmalar ve lisans ders kitabı düzeyine kadar sadeleştirme. Bu adım atlanırsa sonuç, bilgiye dönüşmek yerine cevap olarak kalır.

İmzacılardan Terence Tao, blog yazısında bildirinin önceki hafta madalya sahipleri arasındaki tartışmalardan doğduğunu belirtti ve daha geniş bir yorum süreci için zaman bulunmadığını kabul etti. 25 isim ilk imzacılar ve bildiri daha fazla imzaya açık. Sonunda, yapay zekânın matematiksel anlayışı gerçekten yükseltebileceğini kabul ederken, teknolojinin yükseltip yükseltmeyeceğinin ya da yok edip etmeyeceğinin büyük ölçüde onu kontrol eden insanlar tarafından belirleneceği uyarısını yapıyor.

Bildiriyi doğuran hafta

Zamanlama tesadüf değildi; Nokka'nın dev.to'daki analizi bunu ayrıntılarıyla ortaya koyuyor. OpenAI, 8 Eylül'de yaklaşık 10.000 agent'ın Navier–Stokes problemini 88 saatte çözdüğünü duyurdu. İddia hemen bir atıf anlaşmazlığı doğurdu: NYU'dan Tristan Buckmaster, 7 Eylül'de yaptığı açıklamada, kendisi ve Anthropic'te çalışan matematikçi Levent Alpöge'nin problemin üzerinde bir yılı aşkın süredir çalıştığını ve ilerlemelerinin OpenAI'ye sızdığına dair kanıt bulunduğunu söylemişti. dev.to gönderisinde atıf yapılan CNBC ve BBC haberlerine göre, OpenAI'nin kendi duyurusu da çabanın daha sonradan bu iki araştırmacıya ilişkin olduğu anlaşılan söylentiler duymasının ardından başladığını kabul ediyor.

Nvidia'nın IMO altını için açık tarifi

Bu olayların arasında, 9 Eylül'de Nvidia arXiv'e "An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics" başlıklı bir makale yerleştirdi. Makaleye göre sistem IMO 2026'da 42 üzerinden 30 puan alarak 29 puanlık altın eşiğini geçti; 1, 2, 4 ve 5. problemlerden tam puan, 3 ve 6'dan kısmi puan aldı. Yarışma sonrası gayriresmî bir kontrol, sonradan bulunan kanıtları sayarak toplamı 33'e çıkardı, ancak kaynak gösterilecek rakam 30 olarak kalıyor.

Sistem dışladıklarıyla dikkat çekiyor: resmî kanıtlayıcı yok, harici matematik araçları yok, internet erişimi yok — kanıtlar tamamen doğal dilde yazılıyor. Bu, her adımı Lean'de mekanik olarak doğrulayan AlphaProof ya da DeepSeekProver gibi yaklaşımların tam tersi. Makale ödünleşimi açıkça ortaya koyuyor: doğal dil doğrulayıcı hatalı argümanları da onaylayabilir.

Pipeline yinelemeli bir arama olarak işliyor: aday kanıtlar üret, kontrol et, reddedilenleri eleştiriye dayalı düzeltme için geri gönder, sonra seçim yap. Nemotron 3 Ultra 550B-A55B'den türetilen üç checkpoint — genel kullanıma açık bir model, denetimli bir ince ayar ve pekiştirmeli öğrenme ayarı — farklı roller üstleniyor; kanıt yazmada yetkin bir modelin kusurları tespit etmekte de yetkin olmayabileceği düşüncesine dayanıyor. Arama sırasında kabul için, bir model komitesindeki her hakemin kanıtın geçerli olduğunu ve aynı zamanda ona en yüksek doğruluk puanını vermesini gerektiriyor; tek bir muhalif adayı batırıyor.

Eğitim çabası büyük. Denetimli ince ayar, Nemotron-Math-Proofs-v1'in AoPS bölümünden alınan 15.879 zor kanıt problemiyle başladı; harici modeller 400.000 token'e kadar uzunlukta cevaplar üretti ve üç tura varan düzeltme turu yapıldı; sonuçta 15.818 eşsiz problemden 414.890 örneklilik filtrelenmiş bir küme ortaya çıktı. Nvidia iki eğitilmiş checkpoint, eğitim verisi, eğitim ve çıkarım kodu, gerçek yarışma gönderimleri ve Nemotron-IMO-Bench adlı bir benchmark paketi yayımladı.

Uyarılar

30/42 puanı bağımsız olarak değil, ekip tarafından kendi bildirdiği bir sonuç; makalenin kabul ettiği doğrulama zayıflığı ise doğal dil kontrolüne yapısal bir özellik ve daha fazla eğitimle çözülebilecek bir şey değil. Hiçbir taraf makaleyi madalya sahiplerinin bildirisiyle ilişkilendirmiş değil — bu eşleştirme dev.to yazarının yorumu. Olgusal olan takvim: Nvidia'nın makalesi 9 Eylül'de, OpenAI'nin iddiası 8 Eylül'de, Fields bildirisi 11 Eylül'de.

Neden önemli

Madalya sahiplerinin şikâyeti yapay zekânın matematikte kötü olduğu değil, benchmark güdümlü aceleciliğin çözümleri paylaşılan bilgiye dönüştüren mekanizmaları — yazımları, atıfları ve topluluk incelemesini — söküp atması. Nvidia'nın yayımı bir alternatifin var olduğunu gösteriyor: başkalarının kontrol edip genişletebilmesi için yöntemi, veriyi ve gerçek çıktıları yayımlayın. Temeldeki soru — itibar cevapta mı yoksa onu üreten ve doğrulayan süreçte mi yaşıyor — artık yapay zekânın girdiği her alana uygulanıyor.

  • #ai
  • #mathematics
  • #open-source
  • #nvidia
  • #research

İlgili yazılar