· kaynak Hacker News – Front Page (hnrss.org)
Strata, 12GB VRAM'lı tüketici GPU'larında 125 milyar parametreli Qwen3.8 Flash Next'i çalıştırıyor
Açık kaynak motor Strata, 125 milyar parametreli Qwen3.8-Flash-Next modelini bir oyun bilgisayarından sunuyor; yerel OpenAI ve Anthropic uyumlu API'ler ve 12GB ekran kartı desteğiyle.
GitHub kullanıcısı Niko1221 tarafından yayınlanan ücretsiz ve açık kaynak çıkarım motoru Strata, iddialı bir önermeyle Hacker News ana sayfasına ulaştı: normalde sunucu gerektirdiği belirtilen 125 milyar parametreli Qwen3.8-Flash-Next modelini sıradan bir oyun bilgisayarında çalıştırın. Araç, Windows ve Linux için tek tıkla kurulum dosyaları, yerleşik bir sohbet uygulaması ve tamamen localhost'tan sunulan OpenAI ve Anthropic uyumlu API'ler içeriyor.
Performans iddiası bağlamıyla
Hacker News gönderisinin başlığı bir RTX 4090 üzerinde "100T/s" reklamı yapıyor; bu, yerel LLM jargonunda saniyede 100 token anlamına geliyor. Bu belirli kart, projenin kendi yayınlanan sayılarında yer almıyor. Depo README'sine göre ölçülen kıyaslamalar, bir Ryzen 5 7600 ve 64GB RAM ile eşleştirilmiş bir NVIDIA RTX 5070 (12GB) ile, bir Ryzen 9 3900X ve 47GB RAM'e sahip bir AMD RX 9070 XT'yi (16GB) kapsıyor.
RTX 5070'de Strata, Q2_0 quantization ile saniyede 94 token hızında yanıtlar yazıyor; IQ2_XS ile 79, IQ3_XXS ile 62 ve IQ3_S ile 53 token, ayrıca 32.000 token'lık bir prompt'u saniyede 2.650 token'a varan hızda işliyor. RX 9070 XT, Q2_0 için saniyede 60 token'da kalıyor. README, bir token'ın kabaca bir kelimenin dörtte üçü olduğu ve saniyede 60 token'ın okuma hızını zaten aştığı pratik bilgisini veriyor. Ayrıca daha fazla VRAM'e sahip kartların daha hızlı çalıştığını, bir RTX 3090'un (24GB) yaklaşık 100-140 token/saniye hızında olduğunu tahmin ettiğini belirtiyor — bu da depo belgelemese bile 4090 başlığını makul kılıyor.
Strata ne sunuyor
Projenin vurgusu en az ham hız kadar paketlemede. Kurulum programı ekran kartını algılıyor, hangi model boyutu ve context uzunluğunun kullanılacağını soruyor, yaklaşık 70GB indiriyor ve 127.0.0.1:8080 adresinde sohbet, canlı sistem izleyici ve ayarlarla birlikte yerel bir web uygulaması açıyor. Araç tarafında Strata, /v1 adresinde OpenAI uyumlu bir endpoint, Claude Code gibi uygulamalar için /v1/messages adresinde Anthropic'nin API biçimi ve Codex CLI için /v1/responses adresinde OpenAI Responses API'sini sunuyor — herhangi bir API anahtarı ve herhangi bir model adı kabul ediliyor. Bir MCP sunucusu, AI kodlama asistanlarının motoru kendilerinin kurmasını, başlatmasını ve durdurmasını sağlıyor; görsel girişi isteğe bağlı bir kurulum tercihi, ancak Windows'taki AMD kartlar henüz resimleri okuyamıyor. Strata varsayılan olarak aynı anda tek isteği yanıtlıyor; "parallel": 2 ayarı, tek tek yanıtların yavaşlaması pahasına eşzamanlı yanıtları etkinleştiriyor.
Donanım gereksinimleri ve ödünleşimler
Strata, NVIDIA RTX 20, 30, 40 veya 50 serisi bir kart ya da bir dizi AMD Radeon istiyor; en az 12GB VRAM, en az 32GB sistem RAM'i (64GB her model boyutuna uyor) ve yaklaşık 80GB boş disk alanı, tercihen bir SSD üzerinde. Başlangıç 35-55GB'ı RAM'e yüklüyor ve bilgisayarı bir ila üç dakika boyunca yavaş veya yanıt vermez halde bırakabiliyor; README bunu normal olarak işaretliyor.
Küçük kartlara uyan hızlar ağır sıkıştırmadan geliyor. Kıyaslama tablosundaki en hızlı seçenekler en küçük quant'lar: Q2_0 ve IQ2_XS. Bir "Coder" derlemesi, modelin uzmanlarının yarısını çıkarıyor ve 32GB makinelerine sığması için yazarlarının ölçümüyle tam modelin SWE-bench Verified puanının %91'ine ulaşıyor — ancak kod dışında, Çince ve diğer CJK metinleri de dahil olmak üzere daha zayıf. Bir "Swift 1.5" fine-tune'u yanıtlardan önceki düşünme süresini kısaltıyor. Unsloth'un UD-Q4_K_XL gibi daha büyük quant'ları üretim sırasında çoğunlukla SSD'den okunuyor ve bir 64GB PC'de saniyede 7-8,5 token'a düşüyor. Tesla P40 ve V100'den GTX 10 serisi kartlara kadar eski GPU'lar, topluluk tarafından yazılmış rehberlerle deneysel olarak çalışıyor.
Neden önemli
100 milyar parametre üstü sınıfta bir model, yakın zamana kadar sunucu sınıfı bir iş yüküydü. Tek bir tüketici GPU'sunda — 2-bit kalitesinde bile — etkileşimli olarak sunmak, yerel AI ekonomisini değiştiriyor: Claude Code veya Codex gibi kodlama ajanları, ölçümlü bir bulut API'si yerine bir localhost endpoint'ini hedefleyebilir ve hassas iş yükleri cihazdan hiç çıkmaz. Strata'nın daha geniş katkısı belki de altyapı olabilir: donanım otomatik algılama, kaldığı yerden devam edilebilen indirmeler, yönlendirmeli kurulum ve MCP kontrolü, yerel LLM'leri bir hobi uğraşı olarak tutan sürtünmenin büyük kısmını ortadan kaldırıyor. Uyarı da aynı derecede net — 12GB kartlardaki manşet hızları agresif quantization'a dayanıyor, dolayısıyla daha küçük makineler gerçek bir kalite ödünleşimi taşıyor ve README'deki en güçlü sayılar ölçüm değil tahmin.
- #local-llm
- #open-source
- #qwen
- #inference
- #consumer-hardware
İlgili yazılar
- Screen Memories, macOS'ta her fotoğrafa ve video karesine cihaz üzerinde yapay zekâ araması getiriyor
- Grok-4'ün fiyatı milyon girdi token başına 2 dolara düşerken Qwen, Xiaomi ve Z-AI yeni modellerini piyasaya sürdü
- Headstart, Rust crate'lerinin bağımlılık kontrolleri bitmeden derlemeye başlamasını sağlıyor: yüzde 54'e kadar hızlanma