deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Yandex, sıfırdan eğitilmiş 80B parametreli MoE modeli AliceAI-Foundation-80B-A3B-Base'ı açık kaynak yaptı

Yandex, 262K bağlam penceresine sahip, yaklaşık 18T token üzerinde sıfırdan eğitilmiş, Apache 2.0 lisanslı bir mixture-of-experts taban modeli olan AliceAI-Foundation-80B-A3B-Base'ı yayımladı.

Yandex, sıfırdan eğitilmiş 80B parametreli MoE modeli AliceAI-Foundation-80B-A3B-Base'ı açık kaynak yaptı

Yandex ne yayımladı

Yandex, Hugging Face üzerinde Apache 2.0 lisansıyla (ticari kullanıma izin veren) yayımlanan AliceAI-Foundation-80B-A3B-Base adlı dil modelini açık kaynak yaptı. dev.to üzerindeki teknik bir yazıya göre model, Qwen veya Llama gibi mevcut ailelerden herhangi bir ağırlık ödünç alınmadan, yaklaşık 18 trilyon tokenlık Rusça ve İngilizce metin üzerinde sıfırdan eğitildi.

Model, instruction-tuned bir asistan değil, bir taban model: sohbet etmek yerine metni devam ettiriyor ve Yandex bu yayımı deneysel olarak nitelendiriyor. Şirket, modeli Alice AI asistanındaki agentic özellikleri besleyecek, yakında çıkacak birleşik bir reasoning modelinin mimarisi için bir test yatağı olarak konumlandırıyor.

Yandex'in Ekim 2025'te yayımladığı önceki amiral gemisi olan 235B parametreli Alice AI LLM ile karşılaştırıldığında yeni model toplamda yaklaşık üç kat, aktif parametrelerde ise yaklaşık yedi kat daha küçük. dev.to'da alıntılanan teknik rapora göre buna rağmen model, öncülünü olgusal bilgi, matematik, kod ve uzun bağlam görevlerinde geçiyor.

Seyrek uzmanlar ve lineer attention

Model, 48 katmanlı bir mixture-of-experts tasarımı. Her token, 512 yönlendirilmiş uzmandan 10'unu ve her zaman aktif olan bir paylaşılan uzmanı etkinleştiriyor; böylece model toplamda 80B parametre taşırken token başına kabaca 3B parametreli bir modelin işlem gücünü harcıyor.

Attention yığını, tasarımın daha sıra dışı yarısı. Dört katmandan üçü, dizge geçmişini her önceki token için bir key-value girdisi tutmak yerine sabit boyutlu bir duruma katlayan bir lineer-attention varyantı olan Kimi Delta Attention kullanıyor; kalan katmanlar standart gated attention. dev.to analizine göre bu melez yapı, geleneksel transformer'larda uzun girdileri pahalı hale getiren KV-cache bellek büyümesi olmadan 262.144 tokenlık bir bağlam penceresi sağlıyor.

Nerede kazanıyor, nerede kazanmıyor

dev.to'nun aktardığı resmi model kartındaki rakamlar, taban sürümleri Qwen3.5 35B-A3B, Nemotron-3 Super 120B-A12B ve DeepSeek-V4 Flash 284B-A13B ile karşılaştırıyor.

Rusça konuşan dünyayla ilgili bilgi gerektiren her şeyde model rahat bir şekilde önde ve aktif parametreleri onun dört katı kadar olan rakiplerini geçiyor: WikiWebFacts'ta 86,5'a karşılık DeepSeek-V4 Flash'ta 83,2; EduBench Russian'da 74,2'ye karşılık en yakın rakipte 67,7 ve ExpertFactsQA Law'da 40,5'e karşılık 49,6. Matematik de güçlü: MATH-500'de hiçbir rakibin 84,8'i geçemediği yerde 91,1 alan model, HMMT February 2026'da pass@32 ile 96,9'a imza atarken Qwen3.5 87,9'da kalıyor. LiveCodeBench v5-6 ise 50,5 ile fiilen berabere.

İngilizce odaklı genel bilgi, parametre tavanının belli olduğu alan. TriviaQA'da 79,0'a karşılık Nemotron'da 89,8 ve DeepSeek'te 89,4 var; MMLU-Pro'da 66,8, Nemotron'un 69,9'unun gerisinde; BigCodeBench'te 48,3 ile kıl payı geride ve 128K bağlamdaki LongMemEval, DeepSeek'in 68,0'ının altında kalıyor. dev.to yazarının okuması basit: 80B parametre, 284B kadar dünya bilgisi kodlayamaz.

Yerelde çalıştırılabilir mi?

3B aktif parametre değeri donanım planlaması için yanıltıcı, çünkü 80B parametrenin tamamı bellekte durmak zorunda. dev.to yazısı bunu bf16'da kabaca 160 GB, yazarın kendi tahminiyle 4-bit quantization ile yaklaşık 45 GB olarak veriyor — teoride 64 GB'lık bir Mac'te ulaşılabilir, çünkü MoE modeller token başına yalnızca küçük bir ağırlık dilimi okunduğu için verimli çalışıyor.\n Pratikte bu henüz gerçekçi değil. Resmi tarifler NVIDIA GPU'larda transformers ve vLLM'i kapsıyor ve verilen örnek dört GPU kullanıyor; Kimi Delta Attention katmanları flash-linear-attention çekirdeklerine bağımlı ve yayım gününde GGUF ya da MLX derlemeleri yoktu. Yazar, standart dışı attention'ın llama.cpp desteğini tipik olarak haftalarca geciktirdiğini belirtiyor.

Dikkat edilmesi gerekenler

Asistan olarak faydalı olması için instruction tuning gerektiren bir taban model olmasının ötesinde, en çarpıcı benchmark sonuçlarından ikisi — WikiWebFacts ve HardMultiQA — Yandex'in kendi benchmark'ları. Değerlendirme protokolleri ağırlıklarla birlikte yayımlandı, böylece herkes bunları yeniden çalıştırabilir; ancak üçüncü taraflar bunu yapana kadar yazı, bağımsız benchmark'lara daha fazla ağırlık verilmesini öneriyor. Ayrıca açıkça söylenebilir ki bu bir frontier model değil: ham ölçekten ziyade veri ve mimariyle kazanan kompakt bir model.

Neden önemli

Sıfırdan eğitilmiş gerçekten bağımsız büyük modeller hâlâ nadir; açık bir teknik rapor ve yeniden üretilebilir benchmark'larla izinli lisanslı olanlar ise daha da nadir. Rusça ürünler geliştiren herkes için — özellikle modelin önde olduğu hukuk, eğitim ve referans uygulamalarında — bu bir merak nesnesi değil, kullanılabilir bir temel. Mimarisi de en az kendisi kadar kayda değer: 512 uzmanlı bir MoE'nin lineer ve tam attention'ı 3:1 oranında harmanlayıp 3B aktif parametreyle 262K bağlam sunması, üreticilerin uzun bağlamlı agentic iş yükleri için nasıl tasarım yaptığına dair somut bir açık veri noktası ve aynı zamanda Yandex'in Alice asistanı içinde sunmayı planladığı tasarımın bir ön gösterimi.

  • #open-source
  • #llm
  • #mixture-of-experts
  • #yandex
  • #open-weights

İlgili yazılar