deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Rapor: Anthropic'in Claude Mythos 5.1'ı Lean 4 ile doğrulanmış akıl yürütme ve MCP 2.0 Mesh getiriyor

Bir dev.to gönderisi, Anthropic'in Claude Mythos 5.1'ın kendi akıl yürütmesini Lean 4 proof kernel ile doğruladığını, SWE-bench Verified'de yeni bir rekor kırdığını ve MCP 2.0 Mesh'i tanıttığını iddia ediyor.

Rapor: Anthropic'in Claude Mythos 5.1'ı Lean 4 ile doğrulanmış akıl yürütme ve MCP 2.0 Mesh getiriyor

Rapor ne diyor

5 Ekim 2026 tarihli bir dev.to topluluk gönderisi, Anthropic'in kendi akıl yürütmesini formel proof araçlarıyla doğrulayan bir frontier model olan Claude Mythos 5.1'ı yayınladığını iddia ediyor. Gönderiye göre lansman, oldukça kalabalık bir çıkış dönemine denk geliyor: OpenAI'nin GPT Sol 6.1'ının interaktif kod yürütmede önde olduğu, Google DeepMind'ın Gemini 4'ünün ise 4 milyon tokenlık multimodal girdiyi işleyebildiği belirtiliyor. dev.to raporuna göre Anthropic hız veya context uzunluğu üzerinden rekabet etmek yerine mantıksal halüsinasyona odaklanmış ve modeli, çıkarım sırasında çalışan bir Lean 4 proof derleyicisinin çevresinde yapılandırmış; Isabelle/HOL proof assistant da resimde yer alıyor. Gönderi bunu, bu bileşenleri doğal şekilde birleştiren ilk hyperscale model olarak nitelendiriyor ve başarıyı Dario Amodei liderliğindeki Anthropic araştırma organizasyonuna atfediyor.

Dört aşamalı doğrulama hattı

Gönderi, doğal dil problemlerinin makine tarafından doğrulanmış teoremlere nasıl dönüştüğünü adım adım anlatıyor. Önce autoformalization geliyor: bir istek — bir mantık bulmacası, bir ayrık matematik problemi veya C++ ve Rust kodu için invariantlar — katı ön koşullar ve son koşullarla birlikte tipli bir Lean 4 başlığına çevriliyor. İkinci olarak, proof arama bir ağaç keşfi olarak ele alınıyor: model tüm bir kanıtı tek seferde üretmek yerine, tip teorisi için kalibre edilmiş, tescilli bir Monte Carlo ağaç araması varyantı aracılığıyla ara lemmalar öneriyor; gönderi bu yönteme MCTS-Proof adını veriyor. Üçüncüsü, her tactic yalıtılmış bir Lean 4 kernel sandbox içinde çalışıyor; kernel bir adımı reddettiğinde derleyici hatası, düzeltme sinyali olarak modelin attention katmanlarına geri besleniyor ve arama milisaniyeler içinde başka bir dala yöneliyor. Son olarak, bir kanıt Lean'ın sorry aksiyomu olmadan kapanınca model formel bir sertifika düzenliyor ve üretilen kod için ilgili .lean dosyasını gönderiyor; böylece müşteri ekipler kanıtı kendi taraflarında yeniden derleyip denetleyebiliyor.

İddia edilen rakamlar

dev.to gönderisi, GPT Sol 6.1, Gemini 4 ve GPT-6 Astra ile karşılaştırıldığını belirttiği denetlenmiş karşılaştırmalar sunuyor. Claude Mythos 5.1'ın MiniF2F formel kanıtlarında %88,4'e ulaştığını, rakiplerin ise sırasıyla %74,2, %71,8 ve %76,5 elde ettiğini bildiriyor. Putnam matematik yarışmasında 120 üzerinden 92 puanla altın madalya seviyesini iddia ediyor; rakipler 78, 81 ve 82 puan almış. SWE-bench Verified'de %83,2 ile bir rekor raporluyor — rakipler %81,4, %79,8 ve %75,4'te kalmış — ve MATH-500'de neredeyse kusursuz %99,1. Bu rakamlar gönderinin kendisinden geliyor ve hiçbir bağımsız değerlendirmeye atıf yapılmamış.

MCP 2.0 Mesh ve agent araçları

Modelin yanı sıra gönderi, Model Context Protocol'ün mesh ağ topolojilerini destekleyecek şekilde yeniden tasarlanmış 2.0 sürümünü, yani MCP 2.0 Mesh'i tanımlıyor. Bildirilen özellikler arasında zero-trust tool routing yer alıyor; burada otonom agentlar, mTLS tokenlarıyla kriptografik olarak imzalanmış en az ayrıcalık politikaları altında çalışıyor ve altyapıyı değiştiren araçlar, model güvenlik invariantlarını derleyip doğrulamadan çağrılamıyor. Bir Claude Code Studio CLI'nın kooperatif çoklu agent arka plan oturumlarını desteklediği belirtiliyor: model bir repository klonluyor, yalıtılmış microVM'ler içinde çalışıyor, unit test paketini çalıştırıyor, eşzamanlılık hatalarını düzeltiyor ve formelleştirilmiş bir pull request açıyor. Gönderi ayrıca, gereksiz araç açıklamalarını ayıklayarak sistem token tüketimini erken MCP uygulamalarına kıyasla %65'ten fazla düşüren aktif bir budama mekanizması iddia ediyor.

Tek kaynak, doğrulama yok

Yukarıdaki her şey tek bir dev.to gönderisine dayanıyor. Mevcut materyalde hiçbir Anthropic duyurusu, dokümantasyon sayfası veya ikinci bir haber kaynağı görünmüyor; model adları, tarihler ve benchmark rakamları çapraz doğrulanamadı. Bunlar, teyit edilmiş lansman ayrıntıları değil, doğrulanmamış iddialar olarak okunmalı.

Neden önemli

Rapor, doğru olsun ya da olmasın, makul bir frontier yönüne işaret ediyor: sinir modellerini proof kernel'larla eşleştirmek, böylece kritik çıktılar olasılıksal bir güven yerine makine tarafından doğrulanabilir sertifikalarla gelmek. Bankacılık, otonom araçlar, yarı iletkenler ve savunma için bu, bir modele güvenmek ile onu denetlemek arasındaki fark. Haberi ayrıca güncel rekabeti OpenAI, Google DeepMind ve Anthropic arasında, ham üretim yerine doğrulanabilir akıl yürütme ve agent-agent arası altyapı üzerinden verilen üçlü bir yarış olarak çerçeveliyor. Birincil kaynaklar ayrıntıları doğrulayana kadar benchmark rakamları ilgi çekici bir niyet sinyali, kesinleşmiş bir gerçek değil.

  • #anthropic
  • #claude
  • #formal-verification
  • #lean-4
  • #mcp
  • #llm

İlgili yazılar