deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Tek bir RTX 4090'da 125B modelde 100 tok/s iddiası gerçek, ama küçük yazıda 64GB RAM gereksinimi var

Strata adlı bir repo, Hacker News'te tek bir RTX 4090'da 125B parametreli bir modelin 100 tok/s çalıştığını iddia eden bir başlıkla öne çıktı. Bağımsız ölçümler hızı doğruluyor — yeter ki 64GB+ sistem RAM'iniz olsun ve birimleri karıştıran viral anlatımları görmezden gelin.

Tek bir RTX 4090'da 125B modelde 100 tok/s iddiası gerçek, ama küçük yazıda 64GB RAM gereksinimi var

Strata adlı proje, Hacker News'te akla aykırı bir başlıkla 788 puan aldı: 125 milyar parametreli Qwen 3.8 Flash Next modelinin tek bir RTX 4090'da saniyede 100 token üretmesi. Ashraf Chowdury'nin dev.to'daki gerçeklik denetimi yazısı, rakamın gerçek olduğunu — ama yalnızca iş istasyonu sınıfı bir bellek kurulumu, belirli bir quantization ve speculative decoding'in parladığı iş yükleriyle mümkün olduğunu söylüyor.

Bunu gerçekten mümkün kılan ne

24 GB'lık bir kart hâlâ 125B bir modeli taşıyamıyor; değişen şey modelin mimarisi. dev.to'daki çözümlemeye göre Qwen 3.8 Flash Next, toplam yaklaşık 180B parametreli seyrek bir mixture-of-experts tasarımı — ana modelde yaklaşık 125B, n-gram embedding'lerinde 51B ve bir multi-token-prediction başlığında 4B parametre — ancak token başına yalnızca 6B kadarı aktif. Her token, 48 katman boyunca 512 uzmandan 10'una artı paylaşımlı bir uzmana yönlendiriliyor; 262k doğal bağlam uzunluğu var.

Strata'nın yaklaşımı kavramsal olarak basit: attention, paylaşılan ağırlıklar ve en çok kullanılan uzmanları VRAM'de tutmak, kalan uzmanları sistem RAM'inde bulundurmak ve gerektiğinde PCIe üzerinden çekmek. N-gram tablosu, bir matris çarpımı yerine bir arama olduğu için işe yarıyor — bir deployment'ta 47.7 GiB'lik quantize edilmiş tablonun SSD'de tutulduğu ve verim kaybı yaşanmadığı bildirilmiş. Multi-token-prediction başlığı ise speculative decoding ekliyor: birkaç token taslağı hazırlayıp tek geçişte doğrulamak.

Küçük yazı: sistem RAM'i

Gerçeklik denetiminde özetlendiği üzere Strata'nın gereksinimleri, uzmanların yarısı çıkarılmış bir coder varyantı için 32 GB RAM ile başlıyor (tam SWE-bench Verified performansının yaklaşık %91'i), IQ2_XS derlemesi için 48 GB, önerilen denge olan IQ3_S için 64 GB, UD-IQ4_XS için ise 96 GB veya üzeri RAM gerekiyor.

Manşetteki sayı, yazıda atıf yapılan bağımsız bir 4090 ölçüm reposundan geliyor; bu repo, Ryzen 7900 ve 192 GB DDR5 ile, GPU 280 W'a sınırlandırılarak çalıştırılmış. IQ3_S ile düşük reasoning modunda saniyede 110.8 token metin decode, vision etkinleştirilmişken 97.65 tok/s ve 32K bağlamda soğuk prefill'de yaklaşık 4.750 tok/s kaydedilmiş. 30 durumlu bir çalıştırılabilir DevOps setinde model 30'da 28 puan almış; Q4_K_XL derlemesi ise düşük reasoning ile 30'da 30'a ulaşmış ama reasoning kapalıyken 30'da 27'ye düşmüş. Repo'nun yazarı uyarıları açıkça belirtiyor: tüm uzmanlar ve n-gram tablosu RAM'de kalmalı, kalite sonuçları tek tohumluk (single-seed) ve yalnızca tek istekli servis optimize edilmiş durumda.

Hız, ne ürettiğinize bağlı

Speculative decoding kabul oranı iş yüküne göre keskin biçimde değişiyor: dev.to yazısına göre düz yazıda yaklaşık 0.59, kodda 0.88, yapılandırılmış çıktıda 0.93. Bir Strix Halo makinesinde aynı model düz yazıda yaklaşık 22 tok/s'den koddaki 82 tok/s'ye yükselmiş. Geniş şekilde paylaşılan 100 tok/s fiilen bir kod-ve-yapılandırılmış-çıktı rakamı; konuşma dili belirgin biçimde daha yavaş olacak.

Viral bir anlatım hikâyeyi allak bullak ediyor

İki dev.to yazısı temel gerçeklerde anlaşamıyor. İkinci bir yazının başlığı RTX 4090'ın saniyede 100 trilyon token'a ulaştığını iddia ediyor — kendi sonuç tablosuyla çelişen bir birim hatası; tablo yaklaşık saniyede 100 token listeliyor. O sürüm ayrıca quantize edilmiş modelin CPU offload olmadan yaklaşık 19 GB VRAM'e sığdığını öne sürüyor, ayrı bir 0.5B'lik taslak modele yaklaşık %70 kabul oranı atfediyor ve 350 W güç tüketimi bildiriyor. Tüm bunlar, kartın 280 W'a sınırlandırıldığı 192 GB sistem RAM'inden akışa dayanan bağımsız ölçümle çelişiyor. Bu sapman, benchmark iddialarının yolculuk sırasında ne kadar hızlı değiştiğinin yararlı bir hatırlatıcısı.

Kalite, lisans ve tuhaflıklar

Qwen3.8-27B ile paylaştığı dokuz benchmark'ın tümünde Flash-Next kazanıyor ve ortalama +4.19 puan önde; en büyük fark agentic işlerde: DeepSWE, gerçeklik denetimine göre 42.2'den 58.7'ye çıkıyor. Pratikte onu yerel olarak çalıştırmanın asıl nedeni bu çiğ hız değil, agentic kodlama avantajı.

Lisans Apache 2.0 değil, Qwen Community License 1.0: self-hosting ve ticari kullanıma izin var, ama aylık 100M kullanıcıyı veya 20M dolar geliri aşan ürünler model adını göstermek zorunda ve modeli servis olarak sunmak ayrı lisans gerektiriyor. llama.cpp kullanıcıları 27 Ağustos 2026 veya sonrası bir derlemeye ihtiyaç duyuyor; eski derlemeler mimariyi reddediyor. Günlük tuhaflıklar arasında, ilk açılışta 35–55 GB RAM'e yüklenirken 1–3 dakikalık donma, 12 GB'lık bir kartta 30K token'lık bir prompt için ilk tokene yaklaşık bir dakika ve varsayılan olarak devre dışı bırakılmış paralel istekler var. Hacker News yorumcuları ayrıca 4090'nın 1.600 dolardan çıktığına dikkat çekerek tüketici donanımı ifadesini esnetti.

Neden önemli

Asıl ders mimari olanı. Seyrek uzman yönlendirmesi, SSD'de tutulan arama tabloları ve speculative decoding birlikte yerel çıkarımın darboğazını VRAM kapasitesinden sistem RAM kapasitesine kaydırıyor — ve sistem belleği gigabayt başına çok daha ucuz. Bu, tek bir masaüstünün neler yapabileceğini yeniden çerçeveliyor: belleği doğru speclerseniz, bulut API'si olmadan, 27B yoğun bir alternatifi açıkça geride bırakan agentic kodlama. Bu olay aynı zamanda hype mekaniklerinin bir çalışması: bir reponun özenle uyarılan ölçümü önce Hacker News manşeti, sonra hem birimleri hem mekanizmayı yanlış aktaran viral bir yazı oldu. İddiayı değerlendiren herkes kendi iş yükünü benchmark etmeli, çünkü düz yazı, kod ve yapılandırılmış çıktı aynı modelden üç çok farklı saniyede-token rakamı üretiyor.

  • #local-llm
  • #mixture-of-experts
  • #quantization
  • #rtx-4090
  • #open-source

İlgili yazılar