deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Yerel LLM'ler için ağırlık sınıfı rehberi: Donanımınıza ne sığıyor ve bulut ne zaman daha ucuz

Bir dev.to rehberi, açık ağırlıklı modelleri çalıştıkları donanıma göre sınıflandırıyor — 8 GB dizüstülerden 20.000 dolarlık Mac Studio'lara kadar — ve yerel çıkarımın ancak günde milyonlarca token'da kârlı olduğunu ortaya koyuyor.

Yerel LLM'ler için ağırlık sınıfı rehberi: Donanımınıza ne sığıyor ve bulut ne zaman daha ucuz

Eylül 2026 tarihli bir dev.to rehberi, açık ağırlıklı modelleri sıralamak alışılmadık bir yol izliyor: benchmark puanları yerine, modelleri dört donanım katmanına ayırıyor — 8 GB'lık bir dizüstüden çok düğümlü bir GPU kümesine kadar — ve sonra bir makine satın almanın bir bulut API'si için ödeme yapmayı ne zaman geçtiğini hesaplıyor. Yazar, bunu tarihli bir anlık fotoğraf olarak çerçeveliyor ve rakamların yarısının birkaç ay içinde geçersiz olacağını öngörüyor.

Dizüstü katmanı: 8 ile 16 GB

En alt uçta dev.to, 4-bit quantization ile yaklaşık 3.5 GB olan Phi-4-mini'yi listeliyor; bu model 8 GB'lık bir makinede yalnızca CPU ile çalışıyor ve mantık ile matematik görevlerini yerine getiriyor. Yaklaşık 6 GB'lık Gemma 4 E4B ise 16 GB makineler için en güçlü her amaçlı model olarak gösteriliyor; bunun yanında sohbet ve belgeler için Qwen3 8B ile kodlama işleri için 12–16 GB VRAM gerektiren Qwen3 14B yer alıyor.

Rehberin en pratik uyarısı buraya ait: model ağırlıkları, toplam bellek kullanımıyla aynı şey değildir. Gemma 4 E4B, tam 128K token'lık bağlam çalıştırıldığında ayak izini yaklaşık 12.5 GB'ya iki katına çıkarıyor, çünkü KV cache konuşma uzadıkça büyüyor. Kâğıt üzerinde tam sığacak gibi görünen bir model, görevin ortasında bu sınırla çatışacaktır.

İş istasyonu katmanı: 24 ile 64 GB

Yazarın tatlı nokta olarak öne çıkardığı sınıf bu. Apache 2.0 ile yayımlanan yoğun 27 milyar parametreli bir model olan Qwen3.8-27B, Q4_K_M ağırlıkları için 16.5–19.5 GB artı yaklaşık 1.5 GB runtime ek yükü gerektiriyor — tamamının kullanılmış bir RTX 3090 veya 4090 üzerine sığacak kadar küçük, 262K token'lık bağlam penceresi ve yerleşik görü desteğiyle. Bir 64 GB Mac mini M4 saniyede yaklaşık 7 token üretiyor; rehber bunu etkileşimsiz işler için yeterli diye nitelendiriyor.

Yerel çıkarım için tek bir makine alacak herkese verilen tavsiye şu: 32 GB minimum, 48 GB rahat ve 64 GB, bağlam uzunluğunda ödün vermeyi ortadan kaldırıyor. Yaklaşık 65 GB ile MXFP4'te gpt-oss-120b ve seyrek Qwen3-Coder-Next 80B-A3B de bu sınıfa düşüyor.

Tek büyük makine: 96 ile 512 GB birleşik bellek

Apple'ın 25 Ağustos Mac Studio yenilemesi bu katmanı taşıyor: 512 GB'a kadar birleşik belleğe sahip bir M5 Ultra, 96 GB için 5.499 dolardan başlıyor, 256 GB için 4.000 dolar daha gerekiyor ve 512 GB konfigürasyonu Ekim sonunda gönderiliyor. Seyrek mixture-of-experts modelleri bu mimariye uyuyor, çünkü veri merkezi seviyesinde bant genişliğinden çok kapasiteye ihtiyaç duyuyorlar.

Topluluk kaynaklı rakamlar, token başına 13 milyar aktif parametreli 284 milyar parametrelik DeepSeek V4 Flash'ı 128 GB'lık bir M5 Max üzerinde saniyede yaklaşık 39 token'a yerleştiriyor. Rehber, buradaki diğer rakamların çoğunun motor tahminleri olduğu konusunda uyarıyor, çünkü donanım henüz gönderilmeye başlandı. Llama 4 Maverick 400B yaklaşık 220 GB gerektiriyor ve 512 GB'lık bir makinede saniyede yaklaşık 12 token üretiyor.

Yalnızca rack modelleri

896 expert'e yayılmış 2.8 trilyon parametrelik Kimi K3, teknik olarak yayımlanmış ve indirilebilir durumda, ancak MXFP4 ağırlıkları 1.56 TB yer kaplıyor. Gerçekçi alt sınır FP8 sunumu için yaklaşık 40 GPU ve dev.to, sürekli açık bir 40 GPU dağıtımının yalnızca işlem gücü olarak ayda 60.000–115.000 dolar tuttuğunu, ağ, depolama ve personel hariç, tahmin ediyor.

Bu katmandan yapısal bir ders: token başına yalnızca yaklaşık 104 milyar parametre aktive olsa da, router her an herhangi bir expert'i çağırabildiği için 2.8 trilyonun tamamı bellekte durmak zorunda. Seyrek aktivasyon, token başına aritmetiği azaltır, modelin kapladığı belleği değil.

Bulut fiyatlandırması tutarsız

Rehberin API fiyat tablosu, aynı ağırlıkların çok farklı oranlarla satıldığını gösteriyor: Kimi K3 sağlayıcılar arasında 2.35 katlık, DeepSeek V4 Flash 6.5 katlık bir fark yayıyor. İki sağlayıcı GLM-5.3 için milyonlarca token başına tam olarak aynı 1.40 dolar girişli ve 4.40 dolar çıkışlı ücret alıyor, ancak biri saniyede 149 token üretirken diğeri 29 ile yetiniyor. Sunulan bağlam da çoğu zaman pazarlamada vaat edilenin altında kalıyor: DeepInfra, DeepSeek V4 Pro çıktısını reklamı yapılan 384.000'e karşı 16.384 token ile sınırlıyor.

Neden önemli

İki sonuç öne çıkıyor. Birincisi, başabaş hesabı: 20.000 dolar ya 512 GB'lık bir Mac Studio ya da milyon başına 4.40 dolardan yaklaşık 4.5 milyar çıktı token'ı GLM-5.3 alıyor. Saniyede 10 token'la makinenin bu hacmi üretmesi için on dört yıldan fazla kesintisiz çalışması gerekir. Başabaş noktası, on iki aylık bir ufukta günde yaklaşık 2–3 milyon token'a denk geliyor — bireylerin veya küçük ekiplerin çoğunun gerçekten elinde bulundurduğu sürekli bir akış değil.

İkincisi, yetenek farkı çöktü. Kullanılmış bir oyun GPU'suna sığan yoğun bir 27B model, rehberin alıntıladığı BenchLM toplam endeksinde 2.4 trilyon parametrelik liderin yaklaşık dört puan gerisinde — tam da Çinli açık ağırlık üreticilerinin — yalnızca Qwen, Hugging Face'te bir milyar indirmeyi geçti — ekosisteme hâkim olduğu bir dönemde. Çoğu alıcı için soru artık yerel modellerin yeterince iyi olup olmadığı değil, token hacimlerinin donanımı haklı çıkarıp çıkarmadığı.

  • #local-llm
  • #open-weights
  • #consumer-hardware
  • #inference
  • #apple-silicon