deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

NVIDIA'nın 4.999 dolarlık 64GB DGX Spark'ı 100 milyar parametreli yerel çıkarımı masaüstüne taşıyor

NVIDIA, tek bir kutuda 100 milyar parametreli modelleri çalıştırabilen 64GB DGX Spark'ı 4.999 dolardan satışa sundu; iki cihaz kümelendiğinde 128GB bellekle 200 milyar parametreli çıkarım mümkün oluyor.

NVIDIA'nın 4.999 dolarlık 64GB DGX Spark'ı 100 milyar parametreli yerel çıkarımı masaüstüne taşıyor

NVIDIA'nın masaüstü yapay zeka kutusunda daha uygun fiyatlı bir seçenek

NVIDIA, DGX Spark masaüstünün 64GB konfigürasyonunu Acer, ASUS, Dell, Gigabyte, HP ve MSI üzerinden satmaya başladı; cihaz 23 Ekim'den itibaren 4.999 dolar başlangıç fiyatıyla satın alınabilecek. NVIDIA'nın duyurusuna dayanan Netics Labs'ın dev.io'daki bir gönderiye göre yeni varyant, mevcut 128GB modeldeki her şeyi koruyor: GB10 Grace Blackwell süper çipi, DGX OS ve aynı yapay zeka yazılım yığını. Ana fark, yarıya indirilen 64GB birleşik bellek.

Gönderiye göre NVIDIA, makineyi; bulut sağlayıcısına bağımlı olmak yerine yapay zeka ajanlarının cihaz üzerinde gizli çalışmasını isteyen geliştiriciler, araştırmacılar ve meraklılara konumlandırıyor. Şirket, tek bir cihazın 100 milyar parametreye kadar modelleri tamamen cihaz üzerinde desteklediğini iddia ediyor.

Kutudan ne çıkıyor

Gönderiye göre yazılım paketi, donanımın gerçekten kullanılıp kullanılmayacağını belirleyen şey. Platform; NVIDIA Agent Toolkit, CUDA-X yapay zeka kütüphaneleri ve NVIDIA'nın açık kaynak Nemotron modelleriyle geliyor; ekiplerin halihazırda kullandığı Ollama, vLLM ve PyTorch gibi runtime'ları destekliyor. Yaratıcı tarafında Blender, yükleyicisi yolda olan erken bir destekçi olarak gösteriliyor. Bu liste bir bütün olarak, rack donanımının yerine geçen bir makineden çok; geliştirme ve sürekli çıkarım için, 64GB birleşik belleğe sığan modellere göre boyutlandırılmış bir makineyi tarif ediyor.

Kümeleme sınırı ikiye katlıyor

Duyurunun daha önemli yarısı, iki kutulu hikâye. Her cihaz bir ConnectX-7 ağ arayüzü taşıyor ve iki cihaz, arada switch olmadan doğrudan bir QSFP kablosuyla birbirine bağlanabiliyor. Bu bağlantı 200 GbE bir yapı oluşturuyor, iki sistemin belleğini 128GB'da birleştiriyor, bellek bant genişliğini ikiye katlıyor ve desteklenen model boyutunu 200 milyar parametreye çıkarıyor. Gönderide aktarılan NVIDIA'nın kendi rakamları, kümelenmiş iki 64GB sistemin 27 milyar parametrelik bir Qwen 3.8 iş yükünde tek sisteme kıyasla 1,7 kata kadar performans sağladığını gösteriyor. NVIDIA Sync Cluster Assistant adlı bir araç, algılama, yapılandırma doğrulaması ve ağ kurulumunu üstlenerek her iki düğümün aynı yığını çalıştırmasını sağlıyor.

Netics, küme seçeneğini performans iddiasından çok bir satın alma kararı olarak okuyor: bir ekip tek cihazla başlayabilir ve iş yükü bellek sınırını aştığında, kapasiteyi harcama tetikleyicisi olarak kullanarak ikinciyi ekleyebilir. Gönderi ayrıca, aynı ofisteki iki cihazın hâlâ tek bir fiziksel konum olduğu sınırlamasına dikkat çekiyor; bu, bunu dağıtık altyapı sayma eğiliminde olanlar için önemli. İlgili bir araç olan NVIDIA Sync Model Launcher ay sonunda gelecek ve aynı Qwen modelini tek cihazda ya da kümede indirip başlatarak OpenCode'u bunu kullanacak şekilde yapılandıracak.

Faturada görünmeyen maliyetler

Gönderinin ana argümanı, yerel çıkarımın genelde anlatıldığından daha dar bir anlaşma olduğu. Sabit donanım; iş yükü kutuyu sürekli meşgul edecek kadar istikrarlıysa, verinin binadan hiç çıkmaması avantaj sağlıyorsa ve model satın alınan belleğe sığıyorsa, kiralık hesaplamadan daha iyi. Kullanım patlamalıysa, ekip erteki çeyrekte en büyük hangi model olacaksa ona ihtiyaç duyuyorsa ya da makinenin bakımından kimse sorumlu değilse kiralık kazandırıyor.

O bakım, gizli kalem: bir model kayıt defteri, sürücü, firmware ve runtime güncellemeleri için bir takvim ve bir düğüm yavaş yanıtlamaya başladığında bunu fark eden bir izleme. Sipariş vermeden önce gönderi; gerçekten gereken en büyük modelin bellek sınırına sığdığını, iş yükünün günde en az birkaç saat çalıştığını, veri barındırma gereksinimlerinin anlaşıldığını, güncellemelerden birinin sorumlu olduğunu ve ikinci cihazla bağlantı kablosunun plana fiyatlandığını doğrulamayı öneriyor.

Neden önemli

4.999 dolara 100 milyar parametreli modelleri çalıştıran bir masaüstü kutu, çıkarım işlerinin bütün bir sınıfını, yinelenen bulut faturalarından küçük bir ekibin onaylayabileceği bir sermaye alımına taşıyor. 200 milyar parametreye giden iki cihazlı yol, yazılım ortamını değiştirmeden nefes alanı genişletiyor ve satıcının kendi verdiği 1,7x ölçekleme rakamı pratikte tutarsa, ikinci kutuyu cesur bir sıçrama olmaktan çıkarıp rasyonel bir yükseltme yapıyor. Ama Netics'in de net biçimde belirttiği gibi, ekonomi yalnızca istikrarlı, hassas ve bellek sınırına göre boyutlandırılmış iş yükleri için kapanıyor. Patlamalı kullanımlı ekipler veya en yeni modellerin peşindekiler için kiralık GPU'lar hâlâ daha ucuz yanıt; yerel bir yığının sahipliğinin operational yükü de fiyat etiketi kadar dikkatle tartılmalı.

  • #nvidia
  • #dgx-spark
  • #local-inference
  • #hardware
  • #llm

İlgili yazılar