· kaynak dev.to (home feed)
Meta, doğal 1M token bağlam penceresi ve Mixture-of-Depth yönlendirmesiyle Llama 4 Scout'ı yayınladı
Meta'nın FAIR ekibi Llama 4 Scout'ı yayınladı; model açık ağırlıklı, toplam 105 milyar parametreye, token başına 24 milyar aktif parametreye ve doğal 1 milyon tokenlık bağlam penceresine sahip.
Açık ağırlıklı frontier modeli herkesin erişimine açılıyor
dev.to'da yayımlanan bir gönderiye göre Meta'nın Fundamental AI Research ekibi Llama 4 Scout'ı yayınladı. Gönderi, modeli doğal olarak Mixture-of-Depths yönlendirmesi üzerine inşa edilen ilk frontier sınıfı açık ağırlıklı temel model olarak tanımlıyor. Model toplam 105 milyar parametre taşıyor; herhangi bir token için bunların 24 milyarı aktif durumda. Veri merkezi kümesi yerine kurumsal sınıf donanımda çalışırken, kodlama, matematik ve uzun bağlam görevlerinde önde gelen kapalı reasoning API'leriyle kafa kafaya yarıştığı bildiriliyor.
Mixture-of-Depths hesaplama bütçesini nasıl değiştiriyor
Gönderi motivasyonu şöyle açıklıyor: Geleneksel bir dense transformer, bir virgül olsun ya da çetrefilli bir kod satırı olsun, her tokene aynı derinliği ve hesaplama gücünü uygular. Llama 4 Scout ise her transformer bloğunun içine öğrenilmiş bir top-k yönlendirme kapısı yerleştiriyor. Çıkarım sırasında yönlendirici her tokenin zorluğunu değerlendiriyor; önemsiz tokenler ağır self-attention ve feed-forward katmanlarını atlayan residual kısa yol yollarından geçerken, bilgi yoğunluğu yüksek tokenler tam reasoning yığınından yönlendiriliyor. İddia edilen sonuç, toplam kapasite 105 milyar parametreye genişlerken bile dense 70 milyar parametreli modellere kıyasla üretim gecikmesinde %58'lik bir azalma.
Bir milyon token, doğal olarak
Llama 4 Scout, bağlamı sonradan YaRN gibi RoPE interpolasyon teknikleriyle germek yerine — gönderi bu yaklaşımın 64K tokenin ötesinde perplexity sıçramalarına ve lost-in-the-middle hatalarına yol açma eğiliminde olduğunu belirtiyor — ilk pre-training adımından itibaren bağlamı 1.048.576 tokene uzatan sekiz aşamalı kademeli bir müfredatla eğitildiği bildiriliyor. Attention, RingAttention'ı kayan pencereli multi-head latent attention (MLA) ile birleştiriyor. Gönderi, tam milyon tokenlik aralık üzerindeki Needle In A Haystack benchmark'ında 2.500 farklı belge derinliğinde %99,8 geri alma doğruluğu bildiriyor. Pratikte modelin tek bir prompt içinde bütün kod depolarını, çok ciltli hukuki belge kümelerini veya büyük bilimsel koleksiyonları içine alabildiği söyleniyor.
Bildirilen benchmark sonuçları
Değerlendirmelerin bağımsız üçüncü taraf denetim ekipleri tarafından yürütüldüğünü söyleyen dev.to gönderisi, iki tanınmış ticari modele karşı şu sonuçları listeliyor:
- MMLU-Pro: %78,4; Claude 3.5 Sonnet için %78,0 ve GPT-4o için %77,2
- HumanEval: %92,4; iki rakip için sırasıyla %93,7 ve %90,2
- SWE-bench Verified: Gerçek GitHub sorunlarının %48,6'sı otonom olarak çözüldü; Claude 3.5 Sonnet için %49,0 ve GPT-4o için %38,8
- MATH 500: %81,2; rakipler için %78,3 ve %74,6
Tablo, bilgi ve kodlamada neredeyse eşitlik, agentic yazılım mühendisliği ve matematik setlerinde hafif bir üstünlük ve SWE-bench'te GPT-4o'ya karşı net bir zafer çiziyor.
Erişilebilirlik ve dağıtım
Base, instruction-tuned ve quantize edilmiş checkpoint'lerin — resmi FP8 ve INT4 AWQ varyantları dahil — Hugging Face Hub'dan ve Meta'nın kendi model dağıtım portalından indirilebilir olduğu söyleniyor. 4-bit modda modelin 24GB VRAM gerektirdiği, yani tek bir NVIDIA RTX 4090 veya 5090'nin erişim içinde olduğu bildiriliyor. Runtime desteğinin vLLM, Ollama, LM Studio ve Hugging Face TGI'ye zaten merge edildiği, dolayısıyla Kubernetes kümeleri üzerindeki self-hosted dağıtımların ekosistemin yetişmesini beklemeden çalışması gerektiği belirtiliyor. Gönderi ayrıca modele çok modlu anlama yeteneği atfediyor ve yayını, girişimlere ve veri hassasiyeti yüksek kuruluşlara token başına API ücreti olmadan tam veri egemenliği kazandıran bir hamle olarak çerçeveliyor.
Neden önemli
Bildirilen özellikler doğrulanırsa, Llama 4 Scout açık ağırlıklı modeller için aynı anda iki eksende bir dönüm noktası olurdu: mütevazı donanımda gerçekten self-host edilebilen frontier sınıfı bir model ve interpolasyonlu uzun bağlam modellerini rahatsız eden bozulma olmadan doğal milyon tokenlik bağlam. Bu kombinasyon — API faturası yok, veri dışarı çıkmıyor, bütün depo ölçeğinde prompt'lar — tam olarak kuruluşların açık modellerden istediklerini söyledikleri şey. Ancak uyarılar da aynı ağırlığı hak ediyor. Ayrıntılar Meta'nın resmi duyuru kanalı yerine tek bir topluluk gönderisinden geliyor ve öne çıkan benchmark tabloları kesin zaferlerden çok neredeyse berabere sonuçlar; dolayısıyla frontier eşitliği iddiası, kimse stack'ini buna göre yeniden inşa etmeden önce bağımsız doğrulamayı hak ediyor.
- #open-source
- #meta
- #llama
- #large-language-models
- #long-context