deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Redis'in yaratıcısı antirez, DeepSeek ve Qwen modellerini yerel olarak çalıştıran ds4 adlı hafif bir C motorunu yayınladı

Redis'in yaratıcısı antirez, asimetrik 2-bit quantization kullanarak DeepSeek V4, GLM ve Qwen modellerini yüksek bellekli Mac'lerde ile CUDA veya ROCm donanımında yerel olarak çalıştıran kompakt bir C inference motoru olan ds4'ü yayınladı.

Redis'in yaratıcısı antirez, DeepSeek ve Qwen modellerini yerel olarak çalıştıran ds4 adlı hafif bir C motorunu yayınladı

ds4 nedir

antirez takma adıyla tanınan geliştirici ve Redis'in özgün yaratıcısı Salvatore Sanfilippo, büyük açık ağırlıklı modelleri yerel donanımda çalıştırmak için C ile yazılmış kompakt bir inference motoru olan ds4'ü (DwarfStar 4) yayınladı. Hacker News ana sayfasında görünen dwarfstar.sh adresindeki proje sayfasına göre motor; yüksek bellekli Mac'leri ile CUDA ve ROCm makinelerini hedefliyor, MIT lisansı altında dağıtılıyor ve bilinçli olarak yalnızca birkaç model ailesini destekliyor: hem metin hem de görüntü (vision) varyantlarında DeepSeek V4 ve V4.1 Flash, GLM 5.x ile Qwen3.8 Flash Next.

Bu dar kapsam asıl amaç. Evrensel bir GGUF çalıştırıcısı olmak yerine ds4, desteklenen her model düzenini uçtan uca doğruluyor ve kullanıcıların asimetrik 2-bit quantization artı imatrix ile hazırlanmış, kendine özgü GGUF dosyalarını indirmesini bekliyor. Başka yerlerden indirilen genel amaçlı GGUF dosyaları açıkça hedef kapsamında değil.

284 milyar parametreli bir model yerel belleğe nasıl sığıyor

Öne çıkan iş yükü, projenin 284 milyar parametreli bir mixture-of-experts modeli olarak tanımladığı ve normalde uzak altyapıdan sunulan DeepSeek V4 Flash. ds4'ün yaklaşımı asimetrik quantization: bir MoE modelinin parametrelerinin büyük kısmını oluşturan yönlendirilmiş uzmanlar (routed experts) 2 bit'e sıkıştırılırken, paylaşılan ve ağ üzerinden kritik yollar daha yüksek hassasiyette tutuluyor. Proje, desteklenen yapıların hedeflenen makinelerin belleğine tam olarak bu kombinasyon sayesinde sığdığını söylüyor.

İkinci tasarım tercihi SSD'ye kalıcı olarak yazılan bir KV cache. Uzun prompt önekleri diske yazılıyor ve prompt hash'i üzerinden sürdürülebiliyor; böylece bir yeniden başlatma veya yeniden ziyaret edilen bir sohbet tam bir yeniden prefill zorunluluğu yaratmıyor. Mimari sayfası ayrıca motorun yetenekleri arasında tensor parallelism, oturum toplulama (session batching), speculative decoding ve görüntü girişini sayıyor.

Tek motor, üç arayüz

Üç arayüzün tamamı aynı model durumunu ve cache'i paylaşıyor: ./ds4 etkileşimli bir sohbet CLI'si, ./ds4-server yerel OpenAI ve Anthropic tarzı API'ler sunuyor, ./ds4-agent ise kalıcı oturumlar için tasarlanmış yerel bir kodlama ajanı. Server her iki API lehçesini de konuştuğu için Codex, Claude Code ve OpenCode gibi mevcut araçlar temel URL'lerini bir bulut uç noktası yerine yerel bir ds4 örneğine yönlendirebiliyor.

Kurulum bilinçli olarak kısa: GitHub'daki antirez/ds4 deposunu klonlayın, ds4f-q2 gibi hazırlanmış bir modeli indirmek için birlikte gelen indirme betiğini çalıştırın, make ile derleyin (cuda-spark gibi isteğe bağlı hedeflerle birlikte), ardından CLI'yi başlatın ya da server'ı seçilen bir bağlam uzunluğuyla çalıştırın.

Bildirilen performans ve donanım uyumu

Projenin benchmark tablosu, DeepSeek V4 Flash için Q2'de referans değerleri listeliyor. 128 GB belleğe sahip bir M5 Max üzerinde, 2.048 token'lık bağlamda saniyede 790,2 token prefill ve saniyede 39,4 token üretim bildiriliyor; bu değerler 65.536 token'da sırasıyla 398,5 ve 27,6'ya düşüyor. 128 GB'lik bir DGX Spark üzerinde ise prefill neredeyse sabit kalıyor — 2.048 token'da saniyede 825,8 token ve 65.536 token'da 823,0 — üretim ise saniyede 18,1 ve 13,8 token hızında çalışıyor. Bunlar üçüncü taraf doğrulaması olmayan, proje tarafından bildirilen sayılardır.

Donanım boyutlandırması için proje V4 Flash Q2'yi temel yapılandırma olarak kabul ediyor; 128 GB bellekte GLM 5.3'ün Q2 sürümünün ve Qwen'in Q4 sürümünün de sığdığı belirtilirken, V4.1 Q2 ağırlıklarını SSD'den akıtıyor. Site ayrıca Qwen'in 64 GB'lik bir makinede çalıştırılabildiğini duyuruyor.

Neden önemli

antirez gibi altyapı yazılımında kanıtlanmış bir geçmişi olan bir geliştiricinin yerel inference'a bahis yapması başlı başına bir sinyal. ds4, yerel LLM ekosisteminde karşıt bir konum alıyor: her şeyi yükleyen genel amaçlı bir runtime yerine, minik bir C motorunu sabit ve doğrulanmış bir açık ağırlıklı ön cephe modeli kümesiyle eşleştiriyor ve sıkıştırma yükünün büyük kısmını bu MoE mimarilerinin yönlendirilmiş uzmanlarına yıkıyor. 2 bit'te uzman katmanlarında kalite tutunursa pratik etkisi şu: çok büyük açık modeller insanların zaten sahip olduğu donanımda kullanılabilir hale geliyor ve yerel kodlama ajanları bulut API'lerinden çıkış için güvenilir bir yol kazanıyor.

Uyarılar da gerçek: desteklenen model listesi kısa, genel amaçlı GGUF'ler kapsam dışında ve performans iddiaları projenin kendi tablolarından geliyor. Ancak ön cephe ölçeğindeki ağırlıkların bilinçli olarak görüş bildiren bir araçla bir iş istasyonuna sıkıştırılabildiğinin bir kanıtı olarak ds4, yerel inference alanındaki en ilginç sürümlerden biri.

  • #local-inference
  • #llm
  • #open-source
  • #quantization
  • #deepseek

İlgili yazılar