· kaynak Hacker News – Front Page (native)
48 GB'lik M4 Pro Mac mini üzerinde 35B MoE modeliyle 30 dakikalık yerel LLM yığını
lws.io'da yayınlanan bir yazı, 30 dakikalık yerel LLM yığınını anlatıyor: 48 GB'lik M4 Pro Mac mini üzerinde oMLX tarafından sunulan 35 milyar parametreli bir mixture-of-experts modeli, Tailscale üzerinden telefondan ve dizüstü bilgisayardan erişilebilir durumda.

Kurulum
Bir geliştirici, tamamen 48 GB birleşik belleğe sahip bir M4 Pro Mac mini üzerinde çalışan ve yazarın ifadesine göre yaklaşık 30 dakikada kurulabilen yerel bir büyük dil modeli yığını için çalışan bir reçime yayınladı. Hacker News'in ana sayfasına ulaşan lws.io'daki yazı, makineyi telefondan yapılan hızlı sohbet sorgularından agent arka ucuna kadar her şeyi çalıştıran sürekli açık bir sunucu olarak tanımlıyor.
Yığını dört bileşen oluşturuyor: akıl yürütme ve derinlik için ana model olarak Qwen3.6-35B-A3B-OptiQ-4bit, rutin sohbet ve biçimlendirme için hafif bir seçenek olarak Gemma-4-E4B-it-OptiQ-4bit, inference sunucusu olarak oMLX ve Mac mini ile bir iPhone ile MacBook'u birbirine bağlayan özel ağ olarak Tailscale.
Parçalar nasıl bağlanıyor
Bir agent çerçevesi olan Hermes, Mac mini üzerinde çalışıyor ve aynı yerel modelleri kullanıyor. Yazar, telefonunda Telegram üzerinden ve MacBook'ta uzak arka uç için bir kabuk görevi gören Hermes masaüstü uygulaması üzerinden erişiyor. Tek bir arka ucu paylaşmak, sohbet geçmişinin ve yapılandırılmış yeteneklerin cihazlar arasında senkron kalmasını sağlıyor.
Agent'ın çevresinde, hepsi aynı sunucuyu gösteren birkaç istemci var: gündelik sorular için iOS'ta Apollo, anlık sorgular için Mac'te Raycast AI ve kodlama agent'ı olarak Pi. Yazar, Apollo'yu bağlamanın, Mac mini'nin tailnet adresini göstermek kadar basit olduğunu belirtiyor.
Yerele geçme gerekçesi
Yazarın motivasyonları ham güçten çok kontrolden kaynaklanıyor. Bulut API'leri kiralamaya benzetiliyor, sahiplenmenin tersine: sağlayıcılar fiyatlandırmayı değiştirebilir, kullanım limitleri dayatabilir veya herhangi bir bildirimde bulunmadan sunulan modeli değiştirebilir. Yazar, ayda 200 dolar ödediği iki aboneliği düzenli olarak tükettiğini ve çıktı kalitesinin bazen hiçbir duyuru olmadan düştüğünü fark ettiğini söylüyor.
Gizlilik ve veri egemenliği de etkili. Yazıya göre üçüncü taraf bir API'ye gönderilen veriler tek yönlü bir karar ve bu, hassas kodlar veya müşteri işleri için önemli. Belirli modellere yönelik devlet kısıtlamaları — yazar ABD'deki dağıtım limitlerine işaret ediyor — bir bulut sağlayıcısına bağımlı bir iş akışını çıkmaza sokabilir. Yerel donanım ise sabit maliyetler, daha düşük gecikme süresi, çevrimdışı çalışma ve hız limiti olmaması getiriyor.
Özellikle belirtilmesi gereken nokta: Amaç frontier modellerin yerini almak değil. Yazar, yerel inference'ı günlük isteklerin yaklaşık yüzde 80'ini karşılayacak şekilde konumlandırıyor; bir görev gerçekten gerektirdiğinde bulut modelleri hâlâ kullanılabilir durumda.
Mixture-of-experts hesabı değiştiriyor
Yazının en teknik bölümü bellekle ilgili. Yoğun (dense) ve mixture-of-experts (MoE) modelleri tüketici donanımında çok farklı davranıyor ve yazar, yalnızca parametre sayılarının yanıltıcı olduğunu savunuyor. Qwen3.6 modelinde 35 milyar parametre 256 uzmana yayılmış durumda, ancak herhangi bir token için yalnızca yaklaşık 3 milyarı aktifleşiyor. 48 GB'lik makinede 4-bit derleme yaklaşık 20 GB RAM kaplıyor ve işletim sistemi ile diğer her şey için 28 GB kalıyor. Gemma modeli ise kabaca 2,4 GB gerektiriyor.
Bunun karşılığında yazar, 16 GB'lik bir MacBook Air sahibi arkadaşının örneğini veriyor: 4-bit sıkıştırılmış yoğun bir 27B model yaklaşık 14 GB gerektiriyor ve bu, makineyi tüketerek yavaş SSD swapping'e zorluyor. Bir MoE modelinin aktif ağırlıkları çok daha küçük bir yoğun modelinkine benzediğinden, yazar bu mimarinin büyük modelleri tüketici makinelerinde kullanılabilir kılan şey olduğunu öne sürüyor. Quantization da yardımcı oluyor: OptiQ 4-bit şemasının, sıkıştırılmamış BF16 baseline'a kıyasla kıyaslamalarda yaklaşık bir ila iki pahalattığı belirtiliyor; yazar bunu kabul edilebilir bir ödün olarak görüyor.
Uçuş öncesi kontrol listesi
Yazı, bir modelin donanımınıza uyup uymadığını değerlendirmek için kurallar ortaya koyuyor: önce quantize edilmiş dosya boyutuna bakın (4-bit bir 35B model kabaca 17–20 GB yer kaplıyor), Apple Silicon'da 6–8 GB macOS yükünü düşün, uzun sohbetler için KV cache'e 8–16 GB ayırın ve MoE modellerinde toplam değil aktif parametrelere bakın. Yüzde 10–15 tampon bırakın; daha sıkı bir hesap SSD'ye swapping riski taşır.
Model değiştirmek bir indirme ve bir sunucu yeniden başlatması kadar: oMLX, models dizinine bırakılan dosyaları otomatik olarak keşfediyor ve panosunda bir Hugging Face tarayıcısı bulunuyor. Tailscale sunucuyu genel internetten uzak tutuyor, oMLX tailnet'teki her cihaz için 8000 numaralı portu dinliyor ve KV cache kalıcılığı, önceki bağlama tekrar tekrar dönen kodlama agent'larına yardımcı oluyor.
Neden önemli
Yazı, yerel ile bulut modelleri arasındaki açığın sıradan masaüstü donanımının gerçek, çok cihazlı bir iş akışını taşıyabileceği kadar daraldığının somut bir kanıtı. Bellek hesabı kendi makinesini değerlendiren herkes tarafından yeniden kullanılabilir ve — neyin sığacağını ham parametre sayılarının değil MoE tasarımlarının belirlediğine dair — mimari argümanı, açık ağırlıklı yayınlar giderek bu yapıyı benimsedikçe yararlı bir bakış açısı sunuyor.
- #local-llm
- #apple-silicon
- #llm-inference
- #mixture-of-experts
- #mac-mini