deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Açık ağırlıklı Darwin-180B-RSI, sıfır hukuk eğitim verisiyle İsviçre hukuk sınavı kıyaslamalarında zirvede

VIDRAFT'ın açık ağırlıklı Darwin-180B-RSI modeli, yalnızca kendi ürettiği matematik ve fen çözümleriyle eğitilmesine rağmen LEXam ve LEXam-hard İsviçre hukuk muhakemesi kıyaslamalarında lider; çoktan seçmeli sette 68.94 puan aldı.

Açık ağırlıklı Darwin-180B-RSI, sıfır hukuk eğitim verisiyle İsviçre hukuk sınavı kıyaslamalarında zirvede

Kore girişimi VIDRAFT'ın açık ağırlıklı 180 milyar parametreli modeli Darwin-180B-RSI, Hugging Face'in resmi kıyaslama olarak listelediği iki hukuk muhakemesi lider tablosu olan LEXam ve LEXam-hard'da ilk sıraya yerleşti. Çalışmayı anlatan bir dev.to gönderisine göre model hiçbir zaman hukuk verisiyle eğitilmedi; tek alıştırma materyali, yanıtları otomatik olarak doğrulanabildiği için seçilen matematik ve fen problemleriydi.

Gerçek İsviçre sınavlarından oluşan bir kıyaslama

LEXam, ETH Zürih, Zürih Üniversitesi ve Max Planck Enstitüsü'ndeki araştırmacılar tarafından, İsviçre üniversitelerinde uygulanmış 340 gerçek hukuk fakültesi sınavından, Almanca ve İngilizce olarak derlendi; yanıtları hukuk uzmanlarınca doğrulandı. dev.to gönderisinin açıkladığı gibi, kıyaslama bir modelin mevzuatı ezberleyip ezberlemediğini test etmiyor; modelden bir olgular dizisine hukuku uygulamasını ve bir sonuca muhakemeyle ulaşmasını istiyor. Zorlu bir sınav: çoktan seçmeli bölümde dört seçenek var, yani rastgele tahmin 25 puan getiriyor, buna karşın en güçlü modeller 50 civarında kümelenmişti. LEXam-hard ise, lider açık modellerin en kötü puan aldığı açık uçlu sorulardan oluşan bir alt küme.

Bildirilen puanlar

LEXam'in 1.655 soruluk çoktan seçmeli setinde Darwin-180B-RSI 68.94 puan aldı ve önceki liderin (DeepSeek-R1) 52.41'ini rahatça geride bıraktı. LEXam-hard'ın 518 açık uçlu sorusunda ise önceki en iyi puan olan 40.82'ye (Inkling) karşı 45.72 aldı. Gönderi ayrıca kıyaslamanın yazarlarının öncü modeller için yayımladığı rakamları aktarıyor — GPT-5 62.65, Claude-4.5-Sonnet 58.01, Gemini-2.5-Pro 55.72 — ve Darwin'in öne çıkan 68.94 puanının dört örnek üzerinde çoğunluk oylamasından geldiğini belirtiyor. Tek örnekle bile 60.54 aldı; bu, bildirilen Claude ve Gemini rakamlarının üzerinde, ancak o taban çizgileri aynı koşullar altında yeniden çalıştırılmaktan değil, kıyaslama yazarlarının kendi makalesinden geliyor.

Gönderiye göre değerlendirme protokolü şöyle: LEXam'de soru başına dört örnek, çoğunluk oylaması ve 32.000 token'lık bir düşünme bütçesi; LEXam-hard'da ise tek örnek; token sınırına takılan 60 yanıt 120.000 token ile yeniden üretildi. Açık uçlu yanıtları, kıyaslamanın resmi eval.yaml dosyasında jüri olarak belirtilen DeepSeek-R1-0528 puanladı — yani serbest metin bölümünü insan bir sınavcı değil, bir LLM değerlendirdi.

Kendi işini kontrol ederek öğrenme

Araştırmacıların en yakından inceleyeceği kısım eğitim yöntemi. Ekip model düzeyinde özyinelemeli kendini geliştirmeyi (recursive self-improvement) kullandı: model alıştırma problemlerini çözüyor, her yanıt otomatik olarak doğrulanıyor ve model yalnızca kendi doğru çözümleriyle eğitiliyor; gelişmiş model de sonraki turun çözücüsü oluyor. Problemler yalnızca matematik ve fendi; insan yazımı çözüm veya muhakeme izleri kullanılmadı ve eğitim setinde hiçbir hukuk metni yer almadı.

Bu neden hukuka aktarılıyor? Gönderide belirtilen ekibin yorumu şöyle: doğrulanabilir problemler üzerinde kendini geliştirme, problemi parçalara ayır, her adımı kontrol et, bir sonuca bağla gibi bir muhakeme alışkanlığı eğitiyor ve bu alışkanlık, modelin hiç çalışmadığı bir alana da taşınıyor. Neden-sonuç ilişkisinin kanıtlanmadığını kabul ediyorlar, çünkü üst model hiçbir zaman aynı protokolle LEXam üzerinde ölçülmedi. Yine de ölçtükleri bir etki var: model, üst modelin doğruluğuna yaklaşık %11 daha kısa muhakemeyle ulaşıyor.

Harness düzeyi değil, model düzeyi

Gönderi, yaklaşımı Google'ın yakın zamanda yayımladığı RRSI ile karşıtlıyor; RRSI modeli dondurmuş halde tutup çevresindeki prompt'ları, araçları ve iş akışını iyileştiriyor — harness düzeyinde iyileştirme. Darwin ise model düzeyinde: ağırlıklar değişiyor, dolayısıyla kazanım model dosyasının içinde geliyor ve onu indiren herkes için, hiçbir harness gerekmeden çalışıyor. İkisinin birbirini tamamlayıcı olduğu belirtiliyor.

Kaputun altında Darwin sıfırdan ön eğitim yapmak yerine modelleri evrimleştiriyor: bir üst modeli katman katman ve uzman uzman teşhis ediyor, birkaç modelden en güçlü parçaları taşıyor ve bunları teşhis güvenine göre ağırlıklandırarak harmanlıyor. Aile 50'den fazla resmi model ve 400'ü aşkın topluluk türevini kapsıyor (arXiv 2605.14386). RSI adımı üst modelin parametrelerinin yalnızca yaklaşık %0,02'sini değiştirdi — dikkat yolları ve paylaşılan uzmanlar — 512 yönlendirilen uzmanın tamamı, router ve görü encoder'ı dokunulmadan bırakıldı. ZTC adlı bir bileşen, üretimden önce modelin iç durumunu bir kez okuyarak bir yanıtın doğru olma olasılığını tahmin ediyor.

Bu iki hukuk sonucuyla model, Hugging Face'in yedi resmi lider tablosunda ilk sırada; gönderiye göre bu, Hub'daki herhangi bir kuruluş için en yüksek sayı; Zhipu AI'nin dört, DeepSeek, Xiaomi ve Moonshot AI'nın üçer birinciliği var. Diğer zaferler: AIME 2026 (100), HMMT Şubat 2026 (100), GPQA Diamond (94.44), MMLU-Pro (88.12) ve MMMU-Pro (79.48). Ağırlıklar ve değerlendirme ayarları Hugging Face'te FINAL-Bench/Darwin-180B-RSI altında yayımlandı.

Neden önemli

Puanlar bağımsız değerlendirme altında doğrulanırsa, sonuç lider tablosunda bir sıralama değişikliğinden daha ilginç bir şey öne sürüyor: otomatik olarak kontrol edilebilir problemlerde cilalanan muhakeme yeteneği, modelin hiç karşılaşmadığı bir alana aktarılabilir. Bu, uzman modeller giren herkes için önemli, çünkü alan yetkinliği elde etmek için bir alan derlemine ihtiyacınız olmayabileceğine işaret ediyor. Ayrıca açık ağırlıklı, dolayısıyla bu yetenek tescilli bir harness yerine dosyayla birlikte seyahat ediyor. Uyarılar gerçek — sonuçlar tek bir gönderide kendi tarafından bildirildi, açık uçlu değerlendirmeyi bir LLM jüri yaptı ve ekip kendisi de aktarımın neden işe yaradığını yalıtmadığını söylüyor. Bunu, tekrarlanmayı bekleyen çarpıcı bir araştırma sinyali olarak görün.

  • #ai
  • #llm
  • #benchmarks
  • #open-weights
  • #legal-tech

İlgili yazılar