deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

VIDRAFT, 8 GB VRAM'lı bir dizüstü bilgisayarda çalışan 180B parametreli MoE modelinin 4-bit GGUF sürümünü yayınladı

VIDRAFT, 180 milyar parametreli Mixture-of-Experts modelinin 4-bit kuantalanmış sürümü olan POCKET-Darwin-180B-GGUF'ı yayınladı; model, llama.cpp SSD akışı sayesinde 8 GB VRAM'lı bir oyuncu dizüstü bilgisayarında çalışabiliyor.

VIDRAFT, 8 GB VRAM'lı bir dizüstü bilgisayarda çalışan 180B parametreli MoE modelinin 4-bit GGUF sürümünü yayınladı

VIDRAFT ne yayınladı

VIDRAFT, tüketici donanımında çalışacak şekilde tasarlanmış Darwin-180B-RSI temel modelinin sıkıştırılmış sürümü olan POCKET-Darwin-180B-GGUF'ı yayınladı. Orijinal haberi AI타임스'a atfeden dev.to'daki bir yazıya göre, modelin tamamı VIDRAFT'ın Qwen3.8-Flash-Next adını verdiği bir temel üzerinde 180 milyar parametre taşıyor ve BF16 hassasiyetinde yaklaşık 360 GB yer kaplıyor — bu, normalde çok GPU'lu bir sunucu gerektiren bir boyut.

POCKET sürümü, modelin tamamına 4-bit kuantalama uyguluyor ve boyutu dört GGUF dosyasına yayılmış yaklaşık 111 GB'a indiriyor. Model aynı anda Hugging Face ve ModelScope'a yüklendi; bulut hesabına ya da özel bir çıkarım (inference) sunucusuna yer bulunmayan yerinde (on-premises), ağdan izole ve yerel dağıtımları hedefliyor. İsimlendirme VIDRAFT'ın ürün ayrımını yansıtıyor: RSI (Recursive Self-Improvement) modelin nasıl eğitildiğini, POCKET ise nasıl dağıtıldığını kapsıyor.

180B'lik bir model bir dizüstü bilgisayara nasıl sığıyor

Burada üç teknik üst üste biniyor.

Bunlardan ilki Mixture-of-Experts mimarisi. Darwin-180B, 512 uzman alt ağ içeriyor; ancak öğrenilmiş bir yönlendirici (router) her token başına bunlardan yalnızca 10'unu etkinleştiriyor. Dolayısıyla her token için yapılan aritmetik, 180 milyar parametrenin tamamı depolanmış olsa da yaklaşık 3 milyar etkin parametreye karşılık geliyor. Dev.to gönderisinde açıklandığı gibi, toplam ile etkin parametreler arasındaki bu fark, buradaki agresif sıkıştırmanın yoğun (dense) bir model için olacağından çok daha az yıkıcı olmasını sağlıyor.

İkincisi, 4-bit dönüşümün kendisi. Ağırlıklar BF16'dan 4-bit tam sayılara taşınıyor ve depolama 360 GB'dan 111 GB'a inerken yönlendirme yapısı olduğu gibi korunuyor: model her token için hâlâ 512 uzmandan 10'unu seçiyor, sadece kuantalanmış ağırlıklarla.

Üçüncüsü ise llama.cpp'in ağırlıkları bellekte tutmak yerine bir SSD'den talep üzerine akışlandırabilmesi. Herhangi bir anda yalnızca geçerli token için gerekli uzman ağırlıklarının bellekte bulunması gerekiyor ve 8 GB VRAM artı 32 GB RAM'e sahip bir dizüstü bilgisayarın uygun bir ana makine olmasını sağlayan da bu — SSD fiilen bellek hiyerarşisinin bir katmanı daha haline geliyor.

Bildirilen performans

dev.to üzerinden aktarıldığı şekliyle VIDRAFT'ın kendi testleri şu sonuçları verdi:

  • Sunucu CPU'su, 16 iş parçacıklı tek işlemci: saniyede 18,4 ile 21,0 token, kullanımda 78,8 GB bellekle.
  • 128 GB RAM'e sahip bir mini PC, modelin tamamını bellekte tutarak GPU'suz, yalnızca CPU ile çıkarım yaptı.
  • 8 GB VRAM ve 32 GB RAM'e sahip bir oyuncu dizüstü bilgisayarı, SSD akış modunda saniyede 4,17 token hızına ulaştı.

Doğruluk konusunda VIDRAFT, eşleştirilmiş 2.000 soruluk bir sette kuantalama öncesi ve sonrasında yüzde 87,65'lik bir MMLU-Pro puanı bildirdi. Dev.to gönderisi bunu kendi bildirdiği bir sonuç olarak nitelendiriyor, bağımsız doğrulamayı teşvik ediyor ve kuantalama etkilerinin görev türüne ve prompt tarzına göre değişebileceği konusunda uyarıyor.

Nasıl çalıştırılır

GGUF dosyaları Hugging Face ve ModelScope üzerinde herkese açık. Ön koşullar, güncel bir llama.cpp derlemesi ve yaklaşık 111 GB boş disk alanı. Dosyalar Hugging Face CLI ile indirildikten sonra model llama-cli üzerinden çalışıyor: --n-gpu-layers değerini 0'a ayarlamak saf CPU çıkarımını zorlarken, pozitif bir değer katmanları bir GPU'ya yüklüyor. Dev.to rehberi, kesin dosya adları, önerilen bağlam (context) uzunluğu, sohbet şablonu ve düşük RAM'li makinelerde SSD akışı için önemli olan mmap ayarları konusunda model kartına başvurulmasını öneriyor.

Neden önemli

Bu, yerel yapay zeka için gerçek bir dönüm noktası. Yakın bir zamana kadar 180 milyar parametre sunucu donanımı anlamına geliyordu; bir dizüstü bilgisayarda saniyede 4,17 token hızlı değil, ancak seyrek etkinleştirmesi zaten işlem yükünü azaltan çok büyük MoE modellerinin, 4-bit kuantalama ve diskten talep üzerine ağırlık akışıyla birleştirilerek, daha önce 7B'lik yoğun bir modelin pratik üst sınır olduğu ortamlarda çalıştırılabildiğini gösteriyor.

Verilerin ağdan çıkmasına izin veremeyen kurumlar, kamu kuruluşları ve regüle sektörler için, kendi bildirilen hiçbir kıyasa göre doğruluk kaybı olmayan tamamen yerel bir 180B sınıfı model gerçekten dikkat çekici bir seçenek. Uyarılar da gerçek: rakamlar bağımsız testçilerden değil VIDRAFT'tan geliyor, gerçek dünyadaki verimlilik SSD hızına bağlı olacak ve 111 GB'lık bir indirme hâlâ ciddi bir taahhüt. Yine de, ölçek açısından en üst düzey yetenek ile tüketici donanımı arasındaki uçurum kapanmaya devam ediyor.

  • #local-ai
  • #gguf
  • #llama-cpp
  • #mixture-of-experts
  • #quantization