· kaynak dev.to (home feed)
VIDRAFT'ın Darwin-180B-RSI'si beş Hugging Face liderlik tablosunda ilk sırayı aldı
Koreli girişim VIDRAFT, özyinelemeli öz-iyileştirme döngüsüyle eğitilmiş, 180 milyar parametreli bir mixture-of-experts akıl yürütme modeli olan Darwin-180B-RSI'yı yayımladı; model, beş Hugging Face liderlik tablosunda kendi beyan edilen ilk sıralara sahip.

VIDRAFT ne yayımladı
Koreli yapay zeka girişimi VIDRAFT, mixture-of-experts (MoE) mimarisi üzerine kurulmuş, 180 milyar parametreli açık bir akıl yürütme modeli olan Darwin-180B-RSI'yı yayımladı. AI Market Watch'a atıfta bulunan dev.to'daki bir yazıya göre model, şu anda matematik, fen, genel bilgi ve multimodal akıl yürütme alanlarını kapsayan beş Hugging Face liderlik tablosunda ilk sırada yer alıyor. Bu skorların tümü kendi beyanına dayanıyor ve yazının kendisi de bağımsız bir doğrulama yapılmadığını belirtiyor.
29 Eylül 2026'da yayımlanan dev.to makalesi temel özellikleri listeliyor. Darwin-180B-RSI sıfırdan yapılan bir ön eğitim değil: Seçici model birleştirme (model merging) yoluyla üretilmiş, Qwen3.8-Flash-Next'in bir uyarlaması; bu teknik, yeni yetenekleri sıfırdan eğitmek yerine mevcut checkpoint'lerin güçlü yönlerini birleştiriyor. Birleştirilmiş model, 180 milyar toplam parametresini 512 uzman (expert) arasında taşıyor ve her çıkarım (inference) isteğinde yalnızca 10 uzman etkinleştiriliyor; bağlam penceresi yaklaşık 260.000 token. VIDRAFT modeli açık bir model olarak tanımlıyor ve bildirilen sonuçlar Hugging Face'te barındırılıyor.
Seyrek yönlendirme (routing) tasarımı dağıtım açısından önemli: Token başına hesaplama maliyeti, yoğun (dense) bir 180B modelin maliyetinin çok altında kalıyor; yine de donanımın, her uzmanın ağırlıklarını bellekte tutacak kadar yeterli belleğe sahip olması gerekiyor.
Öz-iyileştirme döngüsü nasıl çalışıyor
İsimdeki RSI, VIDRAFT'ın uyguladığını söylediği eğitim yöntemi olan özyinelemeli öz-iyileştirmeyi (recursive self-improvement) ifade ediyor. dev.to yazısının anlattığına göre model, akıl yürütme problemlerine aday çözümler üretiyor; otomatik bir denetim bu çözümleri doğrulanabilir gerçek cevaplarla karşılaştırıyor ve yalnızca doğru olduğu onaylanan çıktılar ayakta kalıyor. Elde kalan çıktılar daha sonra modeli yeniden eğitiyor ve üretme, filtreleme ile yeniden eğitme döngüsü tekrarlanıyor; bu da ilke olarak modelin kendi doğrulanmış çalışmasından daha iyi akıl yürütme becerisi kazanmasını sağlıyor.
Makale, bu yaklaşımı, insan etiketli veri yerine modelin kendi çıktılarıyla eğinen ret sampling ince ayarı (rejection sampling fine-tuning) ile STaR ve GRPO gibi sonuç-ödül (outcome-reward) yöntemlerinin ailesine koyuyor. İki önemli bilinmeyen var. VIDRAFT, döngünün kaç yineleme çalıştığını, filtreleme ölçütlerinin ne olduğunu veya herhangi bir ödül modellemesinin (reward modelling) dahil olup olmadığını açıklamadı. Ayrıca yaklaşım, bir makinenin doğrulayabileceği cevaplara bağlı olduğundan, öznel alanlardan çok matematik ve biçimsel fene çok daha doğal biçimde uyuyor.
Bildirilen skorlar
dev.to aracılığıyla aktarılan VIDRAFT'ın bildirdiği sonuçlar şöyle:
- AIME 2026: %100
- HMMT 2026: %100
- GPQA Diamond: %94,44
- MMLU-Pro: %88,12
- MMMU-Pro: %79,48
İki yarışma matematigi kıyaslamasındaki kusursuz skorlar duyurunun göz alıcı yanı ve aynı zamanda en çok incelemeyi hak eden kısmı. dev.to yazısı, liderlik tablosu sıralamalarının sabit veri kümelerindeki performansı ölçtüğünü ve üretim iş yüklerine, yeni problem dağılımlarına veya alana özgü görevlere aktarılmayabileceğini açıkça uyarıyor. Modeli değerlendirmeyi düşünen herkes bu sayıları kesinleşmiş gerçek değil, kendi elden çıkarma (held-out) değerlendirmelerini çalıştırmak için bir dürtü olarak görmeli.
Erişilebilirlik ve kendi sunucunuzda barındırma
Yazı, Darwin-180B-RSI'yı Hugging Face'te açık bir model olarak tanımlıyor ancak kesin depo yolunu doğrulayamamış; ayrıca herhangi bir GitHub deposu, API uç noktası veya OpenAI uyumlu sunum URL'si mention etmiyor. Donanım tarafında, MoE tasarımı etkin parametre hesaplamasını makul tutuyor; ancak sunum yine de 180 milyar parametrenin tamamı için bellek gerektiriyor; makale, mevcut donanıma bağlı olarak vLLM veya llama.cpp gibi araçlarla nicemleme (quantisation) ya da uzman boşaltma (expert offloading) gerekebileceğini öneriyor.
Neden önemli
VIDRAFT'ın yaklaşımı tekrarlanma altında ayakta durursa, bu, ölçülebilir akıl yürütme kazanımlarının tam bir ön eğitim turu ve insan ek açıklaması olmadan, mevcut bir taban model üzerinde birleştir-ve-yeniden-eğit hattından gelebileceğini gösteren yararlı bir veri noktası olur. Bu, güçlü açık akıl yürütme modelleri kurma maliyetini epey düşürür. Ayakta durmazsa, bu, özellikle kusursuz skorlar olmak üzere kendi beyanına dayalı liderlik tablosu iddialarının ne kadar hızlı bağımsız testle karşılanması gerektiğinin bir hatırlatmasıdır. Her durumda pratik öneri aynı: Modele bahse girmeden önce kendi görevlerinizde değerlendirin.
- #mixture-of-experts
- #open-weights
- #llm
- #benchmarks
- #model-merging
İlgili yazılar
- MergeKit Cloud, LLM birleştirmeyi yerel donanımdan uzaklaştırıyor ve katkıda bulunacak kişileri arıyor
- Anthropic, Zhipu'nun GLM-5.3'ünün zayıf korumalarla uçtan uca otonom exploit'ler geliştirebildiğini ortaya koydu
- livenerf: açık ve yalnızca-eklemeli benchmark, Claude Opus 5.5'in lansman sonrası performansta düşüp düşmediğini test ediyor