· kaynak dev.to (home feed)
VIDRAFT'ın POCKET-Darwin-180B modeli, 180B parametreli seyrek MoE modelini 8GB VRAM'li bir oyuncu dizüstü bilgisayarına taşıyor
VIDRAFT'a göre 180B parametreli seyrek MoE modeli POCKET-Darwin-180B, expert ağırlıklarını SSD'den llama.cpp üzerinden akıtarak 8GB VRAM'e sahip bir oyuncu dizüstü bilgisayarında çalışabiliyor.

VIDRAFT, 8GB VRAM ve 32GB sistem belleğine sahip sıradan bir tüketici oyuncu dizüstü bilgisayarında çalıştığını iddia ettiği 180 milyar parametreli dil modeli POCKET-Darwin-180B'nin ayrıntılarını yayımladı. dev.to'daki bir gönderiye göre model, seyrek bir mixture-of-experts mimarisini, SSD akışını ve llama.cpp runtime'ını bir araya getirerek bu boyutta bir ağı, birçok kişinin zaten sahip olduğu donanıma sığdırıyor.
Gönderide, Çinli bir yapay zekâ yayın organının duyuruyu geliştiricinin "180B'lik bir model oyuncu dizüstü bilgisayarına taşınıyor" olarak çevirdiği bir başlıkla ele aldığı ve ortaya çıkan çerçevenin projenin kendi hedefiyle örtüştüğü belirtiliyor: çok büyük modelleri yerel olarak çalıştırmak için gereken donanım eşiği ciddi biçimde düştü. Belirtilen hedef veri merkezi değil, çevrimdışı ve izole makine.
180B'lik bir model 8GB'a nasıl sığıyor
Yazıya göre bu işi üç mekanizma yapıyor:
- Seyrek Mixture of Experts (MoE): model toplamda 180B parametre içeriyor, ancak verilen herhangi bir token için yalnızca küçük bir bölümü — gönderiye göre birkaç milyar parametre — aktifleşiyor. İşlem gücü tüm ağa değil, etkin yola harcanıyor.
- SSD akışı: expert ağırlıkları belleğe tamamen yüklenmek yerine diskte tutuluyor. Runtime yalnızca bir isteğin ihtiyaç duyduğu parçaları akıtarak getiriyor; böylece sistem RAM'i ve VRAM tüm model yerine bir çalışma kümesini barındırıyor.
- llama.cpp runtime: mütevazı donanım ve quantize edilmiş ağırlıklar için tasarlanmış, taşınabilir ve yaygın kullanılan bir inference motoru.
Geliştirici, bu tekniklerin birlikte, normalde sunucu sınıfı donanım gerektirecek bir modeli, alıcının elinde zaten olabilecek bir dizüstü bilgisayarda çalışır hâle getirdiğini savunuyor.
Daha yavaş — ve bu kabul ediliyor
Proje, hızın satış noktası olmadığını açıkça belirtiyor. Gönderideki SSS'de dizüstü bilgisayarda yerel inference, ayarlanmış bir bulut endpoint'inden daha yavaş olarak tanımlanıyor. Bu ödünleşme, erişim karşılığında throughput'tan vazgeçiyor: değer, hiçbir harici API'nin hizmet veremediği yerlerde hiç olmazsa çalışabilme yeteneğinde yatıyor.
Nerede çalışması hedefleniyor
Hedeflenen kullanıcılar, verilerini baştan dış bir servise gönderemeyecek kuruluşlar. Gönderiye göre savunma, sağlık ve hukuk iş yükleri, yasa veya politika gereği çoğunlukla izole ağlarda çalışıyor. Bu alıcılar için mevcut yerel donanımda tamamen çevrimdışı çalışan bir model bir kolaylıktan çok bir zorunluluk; geliştirici de POCKET-Darwin-180B'yi bulut API yarışından farklı bir pazara hizmet eden bir çözüm olarak konumlandırıyor.
Neden önemli
İddialar doğruysa bu duyuru, tüketici donanımının yerel olarak çalıştırabileceği şeyin sınırlarını zorluyor: token başına hızdan ödün vererek, 180B parametreli bir model 8GB VRAM'li bir oyuncu dizüstü bilgisayarının erişimine giriyor. Ayrıca çevrimdışı inference'ı bir gösterimden ziyade gerçek bir dağıtım hedefi olarak çerçeveliyor. Yetenekli yerel inference artık yalnızca bulut veri merkezleriyle sınırlı değil; artık güvenli odalardaki bağlantısı kesilmiş donanımlara kadar uzanıyor ve oradaki alıcılar için soru, hangi servisin en hızlı olduğu değil, hangi modelin sahadaki donanımda hiç çalışıp çalışmadığı.
Ayrıntılar, donanım kurulumunu raporlayan ancak hiçbir benchmark verisi içermeyen tek bir geliştirici gönderisinden geliyor; bu yüzden performans iddiaları henüz doğrulanmış değil. Yine de sergilenen formül — seyrek expert aktivasyonu, diskte tutulan ağırlıklar ve hafif bir runtime — diğer aşırı büyük modellerin mütevazı makinelere nasıl sığdırıldığıyla örtüşüyor ve yerel inference'ın bundan sonra hangi yöne gittiğine işaret ediyor.
- #local-inference
- #mixture-of-experts
- #llama-cpp
- #llm
- #on-device-ai