· kaynak Hacker News – Front Page (hnrss.org)
Deltafin fork'u, dört SSD'den tam 2,8T parametreli Kimi K3'ü bir MacBook Pro'ya akıtıyor
ARGODRIVE depolama çalışması içeren bir Deltafin fork'u, kuantlanmamış tam 2,8 trilyon parametreli Kimi K3'ü bir M1 Max MacBook Pro üzerinde çalıştırıyor; expert ağırlıkları SSD'lerden sayfa sayfa okunarak 3,4 saniyede bir token üretiliyor.
Açık kaynak Deltafin projesinin bir fork'u, tam Kimi K3 modelinin — 2,8 trilyon parametreli bir mixture-of-experts sisteminin — tek bir MacBook Pro üzerinde çalıştığını gösterdi; ağırlıklar, model üretim yaparken SSD'lerden akıtılıyor. Fork ile birlikte yayınlanan benchmark'a göre kurulum, bir M1 Max dizüstü bilgisayarda saniyede 0,2901 token sürdürüyor; bu da kabaca 3,4 saniyede bir token demek.
Argonaut Labs tarafından GitHub'da yayınlanan fork, gavamedia'nın MIT lisanslı Deltafin projesi üzerine inşa edilmiş ve yazarların ARGODRIVE depolama çalışması adını verdiği katkıyı ekliyor; ayrıca manifestleri ve sonuçları k3-public-bench dizininde bulunan bir benchmark paketiyle geliyor. Ölçüm araçları ise ayrı olarak ARGODRIVE adıyla yayınlanmış. Projeyi ön sayfaya taşıyan Hacker News gönderisi, donanımı dört SSD'den akış yapan bir Apple Silicon makinesi olarak tanımlıyor.
Ağırlıklar bellekte değil diskte yaşıyor
Kimi K3, veri merkezi ölçeğindeki altyapı için üretilmişti. Projenin README'si, referans dağıtımı kabaca 4,8 TB toplam VRAM'e sahip 16 düğüm olarak, tam checkpoint'ı ise diskte yaklaşık 1,7 TB olarak belirtiyor. Hiçbir dizüstü bilgisayar bunu birleşik bellekte barındıramaz; bu yüzden Deltafin depolamayı modelin evi olarak görüyor ve yönlendirilen expert'leri talep üzerine belleğe sayfalıyor. Yer tasarrufu sağlayan bir akış modu 215 GB'lık bir ayak iziyle başlıyor ve bir makinenin gerçekte kullandığı expert'leri önbelleğe alarak zamanla kısmi bir yerel kopya oluşturuyor.
K3 bir mixture-of-experts modeli olduğu için, parametrelerin yalnızca bir dilimi herhangi bir token'a katılıyor ve disk destekli çalıştırmayı gerçekleştirilebilir kılan da tam olarak bu. Depolama katmanı, router'ın seçtiği expert'leri besleyecek kadar hızlı olmalı ve fork'un yerleştirme ile prefetch çalışması da tam bu noktaya odaklanıyor.
Küçük modeller tahmin eder, K3 doğrular
Throughput kazanımları modeli küçültmekten değil, spekülatif decoding'den geliyor. Varsayılan kurulum, diskte yaklaşık 6,6 GiB olan Inferact'ın Kimi-K3-DSpark'ını draft model olarak içeriyor; bu model ileriyi tahmin ederken tam K3 her token'ı doğruluyor — README'ye göre hedef modelin onayı olmadan hiçbir şey kullanıcıya ulaşmıyor. Yaklaşık 4,3 GiB'lık isteğe bağlı bir Qwen eklentisi yalnızca ham metin tamamlamayı hızlandırıyor ve proje, aynı çıktı token ID'leriyle üretilen 17 token'lık bir tamamlamanın 2,7 kat daha hızlı çalıştığını ölçmüş.
README'nin benchmark geçmişi yörüngeyi gösteriyor: 27 Temmuz 2026'da saniyede 0,0141 token, bir gün sonra 0,1311, 30 Temmuz'da 0,2660, 2 Ağustos'ta 0,2847 ve son çalışmada 0,2901 — bu, kaydedilen ilk rakamdan bu yana yirmi kattan fazla bir kazanç, ancak son güncellemeler tek haneli düşük yüzde iyileşmelerine küçülmüş durumda.
Esas nokta sadakat
Proje kalite konusunda net bir çizgi çekiyor. K3'ün expert bankasını yaklaşık 3 bite yeniden kodlayan diğer girişimleri eleştiriyor; ortaya çıkan ağırlıkların artık Moonshot'un yayınladığı şey olmadığını ve sıkıştırmanın neye mal olduğunu kimsenin ölçmediğini savunuyor. Deltafin eksiksiz 16 expert'lik bankayı koruyor ve her token'a K3'ün kendi yönlendirmesinin karar vermesine izin veriyor; hiçbir expert atlanmıyor ve yeniden kuantlanmış ikame kullanılmıyor.
Yazarlar çalışmayı bir ürün değil deney olarak çerçeveliyor: 2.000.000 dolarlık bir küme yerine tahminlerine göre 15.000 dolarlık bir ev kurulumunda bir frontier modeli çalıştırılabilir kılmaya yardımcı oluyorsa, bunu kendi kendine barındırılan yapay zeka için değerli bir ilerleme olarak görüyorlar. Pratikte Deltafin, Rust'ın cargo araç zinciriyle derlenen tek bir native binary olarak dağıtılıyor; chat ve completion endpoint'lerine sahip OpenAI uyumlu bir sunucu açıyor ve uzun konuşmaların, prefill ve önbellek maliyetleri geçmişle büyüdüğü için kısa tamamlamalardan çok daha yavaş çalıştığı konusunda uyarıyor.
Neden önemli
3,4 saniyede bir token hiçbir şekilde etkileşimli değildir ve proje de aksini iddia etmiyor. Önemi, bunun hiç çalışmasıdır: çok düğümlü GPU kümeleri için tasarlanmış bir checkpoint artık tüketici donanımında, uçtan uca, değiştirilmemiş ve kuantlanmamış şekilde çalışıyor. Bu, yerel çıkarım için pratik tabanın nerede olduğunu gösteriyor — hızlı NVMe, seyrek expert yönlendirmesi ve spekülatif decoding birlikte, modelin ihtiyaç duyduğu varsayılan VRAM'in büyük bir bölümünün yerine geçebiliyor. Benchmark paketinin ve ölçüm araçlarının ayrı ayrı yayınlanması, iddiaları anekdot değil denetlenebilir kılıyor. Ve temeldeki sorun — hangi expert'lerin prefetch edileceğine, nereye yerleştirileceğine ve ne zaman çıkarılacağına karar vermek — bellekten büyük modelleri çalıştırmaya çalışan her proje için geçerli. Depolama bant genişliği iyileştikçe, "VRAM'e sığıyor" ile "yerelde çalışıyor" arasındaki çizgi sürekli yer değiştiriyor.
- #local-inference
- #apple-silicon
- #llm
- #open-source
- #moe