· kaynak dev.to (home feed)
SOKKAN, içinde hiç NVIDIA bulunmayan dört Intel Arc Pro B60 GPU ile İsviçre inference katmanını başlattı
Cenevre merkezli bir şirket, kendi mülkiyetindeki Intel Arc Pro B60 donanımından yapay zeka inference hizmeti satıyor ve NVIDIA dışı bir yazılım yığınının sınırlarının yanına ölçülmüş throughput verilerini de yayımlıyor.

Cenevre merkezli Ninabot Sàrl'nin ürünü SOKKAN Inference, şirketin Cenevre Meyrin'de sahibi olduğu — ve içinde hiç NVIDIA çipi bulunmayan — donanımda çalışan Swiss adlı bir inference katmanıyla hizmete girdi. dev.io üzerindeki bir mühendislik yazısında ekip, hem ölçtükleri throughput değerlerini hem de yığınının tıkandığı noktaları yayımladı; bu da Intel Arc Pro donanımında modelleri ticari olarak sunan hesaplardan daha açık sözlü olanlardan biri hâline getirdi.
Donanım bahsi
Yazıya göre SOKKAN, zaten Fransız veri merkezlerinden iki AB-egemen katman işletiyordu ama verilerinin İsviçre'den hiç çıkamayacağı müşteriler için bir cevabı yoktu. Bellek kıtlığının ortasında GPU satın almak onları NVIDIA'dan uzaklaştırdı: ikinci el RTX 3090 peşinde geçen bir ay kaybedilen açık artırmalarla sonuçlanırken, Intel Arc Pro B60 — 2 slotluk blower kart üzerinde 24 GB VRAM — kart başına 614 İsviçre frangı MSRP civarında hâlâ satın alınabilirdi. Dört kart kabaca 2.450 İsviçre frangına mal oldu ve 96 GB VRAM sağladı. Şasi, i9-9980XE ve 64 GB DDR4'ye sahip, üretim iş yüklerini de taşıyan 2018 tarihli bir X299 iş istasyonu; yazarlar bu yüzden her benchmark'ın kötümser olduğunu söylüyor.
Kartlarda ne çalışıyor
Üç model bellekte sürekli olarak tutuluyor. 0 numaralı kart, vLLM 0.21'in Intel XPU sürümünde MXFP4 formatında gpt-oss-20b çalıştırıyor ve 13 GB kaplıyor. 1 numaralı kart, llama.cpp'nin SYCL arka ucu üzerinden Q4_K_XL GGUF olarak Qwen3-Coder-30B-A3B sunuyor ve 17,7 GB kullanıyor. 2 ve 3 numaralı kartlar birlikte, yine llama.cpp SYCL üzerinden Q3_K_XL seviyesinde Qwen3-Next-80B-A3B'i 35,6 GB ile tutuyor. Üçü de yaklaşık 3B aktif parametreli mixture-of-experts modeller; tek makinede bir arada yaşamalarını sağlayan da bu. Swiss katmanının kendisi 0 numaralı kart.
Ölçülen sayılar
vLLM altındaki gpt-oss-20b için tek istek saniyede 35,1 token sürdürüyor, dört eşzamanlı istek hâlâ istek başına 33,6 tok/s ile toplam 133,9 tok/s alıyor ve daha önceki bir koşuda sekiz eşzamanlı istekle toplam 241 tok/s'ye ulaşılmış. Prefill, 4.300 token'lık bir prompt'ta saniyede yaklaşık 5.000 tok/s ölçülüyor ve continuous batching, yük arttıkça istek başına hızı neredeyse düz tutuyor. Dört kartın toplam güç tüketimi boştayken 163 W, on iki eşzamanlı istek altında zirvede 211 W ve sıcaklıklar 52–62 °C. Makinenin tamamı UPS yükünde yüzde 13'ten yüzde 19'a çıkıyor; bu da İsviçre fiyatlarıyla yılda kabaca 750 İsviçre frangı elektrik demek. Tool calling üç modelde de çalışıyor, ancak gpt-oss belirli vLLM flag'lerini ve harmony parser'ını gerektiriyor; bunlar olmadan istekler sıfır tool call ve boş içerik döndürüyor.
Ölçeklenmediği yer
80B model zayıf halka ve yazı bunun modelden değil runtime'dan kaynaklandığını belirtiyor. llama.cpp'de continuous batching olmadığı için eşzamanlılık altında 80B, tek kullanıcıda 32,0 tok/s'den iki kullanıcıda kişi başı 14,5 tok/s'ye ve dört kullanıcıda kişi başı 7,0 tok/s'ye düşüyor — toplam throughput ise 32'den 20,7 tok/s'ye geriliyor, yani dört kullanıcı bir kullanıcından daha az toplam iş tamamlıyor. Intel XPU üzerindeki vLLM ise yalnızca yerel bir XPU çekirdeğine sahip quantisation'ları sunabiliyor: MXFP4 gpt-oss çalışıyor ama ekibin denediği diğer tüm quantize MoE'ler expert katmanlarını NVIDIA çekirdeği olan Marlin'e yönlendirdi ve device_capability hatasıyla başarısız oldu. Dense AWQ, float16 zorlanırsa çalışıyor; AWQ MoE çalışmıyor. Dört kart arasında vLLM tensor parallelism denemeleri, bol miktarda boş RAM olmasına rağmen makineyi günde üç kez kilitledi; yazarlar bunun bellek baskısı değil, eski chipset üzerinde bir DMA veya PCIe sorunu olduğundan şüpheleniyor. Sıralı yükleyen llama.cpp ise gpt-oss-120b'yi sorun çıkarmadan dört karta yayarak saniyede 18,8 tok/s decode hızıyla çalıştırdı.
Satılan katman
Ticari teklif bilinçli olarak dar kapsamlı: sohbet, RAG ve agent'lara uygun, ama uç seviye kod yazımına uygun olmayan bir 20B sınıfı model. Veriler İsviçre'de kalıyor, failover bir AB sağlayıcısına değil Cenevre'deki komşu karta yapılıyor ve o da erişilemezse istemci sessiz bir sapma yerine net bir hata alıyor. Kapasite dört eşzamanlı istekle sınırlı; bunun üzerinde API kuyruğa almak yerine 429 döndürüyor. Fiyatlandırma milyon girdi token'ı başına 0,60 İsviçre frangı ve milyon çıktı token'ı başına 2,40 İsviçre frangı; ön ödemeli ve token'a göre ölçümlü. Endpoint, Anthropic Messages uyumlu olduğu için Claude Code ve diğer Anthropic istemcileri yalnızca ortam değişkenleri değiştirilerek çalışıyor. Şirket, ham token yeniden satmanın iş modeli olmadığını söylüyor; asıl amaç, aynı yerleşim garantisiyle modelin üzerine hizmetler barındırmak ve aynı dört kartlı yapılandırma, bulutu tamamen yasaklamış kuruluşlar için bir on-prem cihazı olan SOKKAN Anchor'a dönüşüyor.
Neden önemli
Bu yazı, NVIDIA donanımı olmadan ticari bir inference hizmeti işletmek konusunda nadir bir kamusal veri noktası. Intel yolunun küçük ölçekte uygulanabilir olduğunu gösteriyor — istek başına 35 tok/s ve vLLM altında doğrusala yakın ölçeklenme gerçekten kullanılabilir — aynı anda tavanı çipin değil yazılım yığınının nerede belirlediğini tam olarak belgeliyor: llama.cpp'de continuous batching yokluğu ve vLLM'de çalışan XPU çekirdeklerinin azlığı. Katı veri yerleşimi gereksinimleriyle karşı karşıya olan ekipler için, dürüst başarısızlık biçimleri ve yerinde kalıp başarısız olma (fail-in-place) failover politikası dahil burada anlatılan mimari, egemen bir inference katmanının bugün gerçekte neyi vad edebileceğine dair yararlı bir referans.
- #intel-arc
- #ai-inference
- #vllm
- #llama-cpp
- #data-sovereignty