· kaynak dev.to (home feed)
998 dolara 0.384 CORE'a eğitilmiş 3,8 milyar parametreli bir LLM
dev.to'da yayımlanan bir yazı, ucuz GPU'lar, agresif veri filtreleme ve sharded training kullanılarak yoğun (dense) 3,8 milyar parametreli bir modelin toplam 998 dolara 0.384 CORE puanına ön-eğitildiğini aktarıyor.

İddia
dev.to'da yayımlanan bir yazı, toplam 998 dolar harcamayla yoğun (dense) yapıda, 3,8 milyar parametreli bir dil modelinin ön-eğitimini ve bitmiş modelin CORE üzerinde 0.384 puan aldığını ayrıntılarıyla anlatıyor. Yazar bunu Coherence and Reasoning Evaluation olarak açıyor; ezberleme yerine mantıksal sentez yeteneğini ölçmeyi amaçlayan bir benchmark bu. Gönderide "Little LM" olarak adlandırılan proje, ön-eğitimin yalnızca aylar süren işleri milyon dolarlık kümelerde çalıştıran hyperscaler'ların tekelinde olduğu varsayımına bir karşı örnek olarak konumlandırılıyor.
Bellek ayak izini küçük tutmak
Model Mixture-of-Experts değil yoğun (dense) bir tasarıma sahip olduğundan verimlilik çalışması attention'a odaklanmış. Grouped Query Attention kullanılıyor; gönderideki referans yapılandırma 32 query head'e karşılık 8 key-value head, 128 head boyutu ve 4096 hidden size belirtiyor. Key-value head sayısı query head'lerden çok daha az olduğu için KV cache küçülüyor, bellek baskısı düşüyor ve daha büyük batch boyutları prosumer sınıfı kartlara sığıyor. Yazıya göre bu, çalışmanın InfiniBand veya RDMA bağlantıları olmadan — ticari eğitimde önemli bir maliyet artırıcı olan bu unsurlar devre dışı bırakılarak — A6000 veya L40s GPU kümelerine sığmasını sağlamış. Parametre verimliliği seçimleri arasında rotary positional embedding'lere de değiniliyor.
Çıkarmaya dayalı bir veri hattı
İşlem maliyeti işlenen token sayısıyla ölçeklendiğinden, 998 dolarlık bir bütçede corpus'un biriktirilmesi değil hak edilmesi gerekiyor. Yazarın anlattığı pipeline; az gradient sinyali taşıyan neredeyse birebir aynı belgeleri eleyen MinHash deduplication, boşluk-metin oranına, ortalama token uzunluğuna ve stop-word yoğunluğuna dayalı sezgisel filtreler ve corpus'u dilsel olarak homojen tutan dil tanımlama üzerine kurulu. Yaklaşım Chinchilla-optimal olarak tanımlanıyor: eğitim verisi model boyutuyla birlikte ölçeklendiriliyor böylece 3,8 milyar parametre az eğitilmiş kalmıyor.
998 dolar nereye gidiyor
AWS P4d veya GCP A100 kümeleri gibi premium kurumsal instance'lar saatlik ücretleri nedeniyle eleniyor. Bunun yerine çalışma alt kademe kapasiteyi hedeflemiş ve kesintilerden sonra eğitimin sorunsuz devam edebilmesi için checkpoint ayarları özenle yapılmış. Yazı bu noktada tamamen tutarlı değil; bir yerde spot-instance ihalesinden, başka bir yerde ise preemptible olmayan ama ucuz GPU'lardan söz ediyor; ortak payda, daha düşük ücretler karşılığında altyapı dalgalanmalarına tahammül. Eğitim stack'inin kendisi; tek GPU VRAM'i içinde etkili batch boyutunu yükselten gradient accumulation, hız ve kararlılık için BF16 mixed precision ve model tek GPU'nun belleğini aştığında model state'lerini, gradient'leri ve optimizer state'lerini cihazlar arasında paylaşan FSDP'den oluşuyor.
Puanın doğrulanması
3,8B ölçeğinde 0.384'lük bir CORE sonucu basitçe eğitim dağılımına aşırı uyumu (overfitting) yansıtabilir; bu yüzden geliştiriciler puanı denetlemek için akademik akıl yürütme veri kümeleriyle out-of-distribution testler yaptıklarını bildiriyor. Yazar sonucu data-constrained scaling'e bağlıyor: yeterince çeşitli olduğu takdirde, daha küçük ve temiz bir corpus ile eğitmenin, gürültülü büyük ölçekli kazımalara ancak çok daha fazla işlemle yaklaşılabilecek bir performans platosuna ulaşabileceği gözlemi bu.
Neden önemli
Sayılar tek bir yazarın gönderisinden geliyor ve bağımsız olarak doğrulanmış değil; ayrıca CORE yaygın kullanılan bir baş benchmark değil, dolayısıyla 0.384 rakamı en iyi ihtimalle projenin kendi ölçümü olarak, karşılaştırılabilir bir puan olarak değil okunmalı. Bu uyarıya rağmen gönderi, ön-eğitimin demokratikleşmesine ilişkin faydalı bir veri noktası. Yazar üç sonuç çıkarıyor: parametre verimliliği yeterince kullanılmıyor — GQA ve RoPE gibi teknikler daha az parametreye daha fazla yetenek sığıdırıyor; FSDP, DeepSpeed ve Megatron gibi olgunlaşan yazılım stack'leri giderek ucuz, heterojen donanımlarla başa çıkıyor; ve bağlayıcı kısıt ham işlem gücünden yüksek kaliteli veri seçimine kayıyor. Bin doların altındaki ön-eğitim rutin bir yetenek haline gelirse sınır sorusu "en büyük model nasıl kurulur"dan "en küçük kaynak ayak izinden en fayda nasıl çıkarılır"a dönüşüyor ve özel alan-özel modeller bir ekibin kiraladığı değil inşa ettiği şey oluyor.
- #llm
- #pre-training
- #gpu
- #machine-learning
- #data-quality
İlgili yazılar
- MCP'nin Sampling özelliği sunucuların modelinizi prompt etmesine izin veriyor ve onay kapısı istemciye göre değişiyor
- dealignai, DeepSeek-V4.1-Flash'ın 1M bağlam ve görsel destekli sansürsüz FP8 sürümünü yayınladı
- Gateway logları: LLM API çağrılarının %12'si yanıt dönmüyor ve retry'lar maliyeti katlıyor