· kaynak Hacker News – Front Page (native)
Qwen 3.8 27B, Cerebras inference endpoint'lerinde saniyede 1500 token hızında çalışıyor
Hacker News'in ana sayfasına taşınan bir gönderi, Qwen 3.8 27B'nin Cerebras üzerinde saniyede 1500 token hızıyla yayına alındığını bildiriyor; şirketin kataloğu budanmamış modelleri ve yalnızca depolamaya yönelik weight quantization detaylarını açıklıyor.
Qwen 3.8 27B saniyede 1500 token hızında
Hacker News'in ana sayfasına taşınan bir gönderi, Qwen 3.8 27B'nin artık Cerebras'ın inference servisinde yaklaşık saniyede 1500 token hızıyla kullanılabildiğini bildiriyor. Gönderi, Cerebras'ın model kataloğuna bağlantı veriyor; bu dokümantasyon sayfası şirketin herkese açık endpoint'lerinde sunulan tüm modelleri listeliyor ve bu modellerin nasıl barındırıldığını açıklıyor.
Asıl hikaye bu rakam. 27 milyar parametreli bir açık ağırlıklı (open-weight) modelin paylaşımlı bir API üzerinden saniyede 1500 token mertebesinde üretim yapması alışılmadık derecede yüksek bir üretim hızı; geleneksel GPU'lar yerine wafer-scale yapay zeka hızlandırıcıları üreten Cerebras, ham inference hızını merkezdeki vaadi haline getirmişti. Güncel bir açık ağırlıklı Qwen sürümünü eklemek, bu vaadi hız odaklı platformların genellikle öne çıkardığı yalnızca küçük veya orta boy seçenekler değil, sınır modellerine yakın açık modeller isteyen geliştiricilere kadar genişletiyor.
Model kataloğu neleri kapsıyor
Cerebras'ın dokümantasyonuna göre, herkese açık endpoint'lerdeki modeller hem ücretsiz deneme katmanında hem de paylaştıkça öde (pay-as-you-go) modelinde kullanılabiliyor; hız limitleri ve fiyatlandırma geçerli. Ayrılmış kapasite, daha yüksek işleme hızı, üretim seviyesinde hizmet seviyesi sözleşmeleri (SLA) ve ek model aileleri ise bunun yerine adanmış endpoint'ler üzerinden sunuluyor.
Sayfa ayrıca compression konusuna da genişçe yer veriyor; bu, bir model listesi için alışılmadık düzeyde detay ve açıkça tam olarak ne çağırdığını bilmek isteyen geliştiricilere yönelik.
Orijinal mimariler, yalnızca depolamaya yönelik quantization
Cerebras, herkese açık endpoint'lerinde budanmış (pruned) model sunmadığını belirtiyor; oradaki her model orijinal, budanmamış sürüm olarak tanımlanıyor. Şirket REAP (Router-weighted Expert Activation Pruning) adı altında budama araştırması yapıyor, ancak budanmış varyantlar paylaşımlı API üzerinden sunulmak yerine Hugging Face üzerinde araştırmacılarla paylaşılıyor.
Quantization ayrı ele alınıyor. Ağırlıklar, 16-bit, 8-bit ve 4-bit hassasiyetin kısmi bir karışımıyla seçici, yalnızca ağırlıklara yönelik (weight-only) quantization ile depolanıyor; hassas kabul edilen katmanlar tam hassasiyette kalıyor ve işlemler yüksek hassasiyette çalışsın diye yüklenirken dequantize ediliyor. Dokümantasyona göre aktivasyonlar, attention hesaplaması ve KV cache tam hassasiyette tutuluyor ve quantize edilmiyor.
Şirketi sunulan mimarilere dokunmama konusunda da taahhütte bulunuyor: bir modelin mimarisini haber vermeksizin değiştirmeyecek ve gelecekte çıkabilecek budanmış sunumlar, geliştiriciler hangi sürümü kullanacaklarını seçebilsin diye budamaya özgü adlar taşıyan ayrı endpoint'ler olarak görünecek.
Neden önemli
Hız, geliştiricilerin neler inşa edebileceğini değiştiriyor. Agent döngüleri, çok adımlı kod üretimi ve uzun metin yazımı hep token'ların ne kadar hızlı geri geldiğiyle kısıtlanıyor; saniyede 1500 token hızı bu iş yüklerini yavaş toplu işlerden etkileşimli hale getiriyor, üstelik kimsenin donanım satın alıp işletmesi gerekmeden.
Şeffaflık taahhütleri de önemli. Barındırılan açık ağırlıklı modellerde yaygın bir endişe, sunulan sürümün sessizce yayımlanan ağırlıklardan farklı olması. Budanmamış mimariler vaat ederek ve quantization'ı depolamayla sınırlayarak Cerebras, geliştiricilere API'nin gerçekte ne çalıştırdığına dair daha net bir söz veriyor.
Son olarak, açık ağırlıklı bir model için hızlı barındırılmış inference, kapalı model API'leri üzerindeki rekabet baskısını koruyor: geliştiriciler, ağırlıkları kıyaslama, inceleme ya da gerekirse kendilerinin barındırma yeteneğinden vazgeçmeden hıza kavuşuyor.
- #cerebras
- #qwen
- #inference
- #open-weights
- #llm
İlgili yazılar
- FineTune Studio, Qwen3-1.7B'yı yaklaşık 3,2 GB VRAM ile QLoRA üzerinden fine-tune ediyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- Runtime gateway'leri ve katmanlı savunmalar: ekipler yapay zeka agent'lerini üretimde nasıl yönetiyor