· kaynak Hacker News – Front Page (native)
Etched'in Sohu ASIC'i, yalnızca transformer tabanlı silikoniyle Llama 70B'de saniyede 500K token iddiasında bulunuyor
Etched'in yalnızca transformer odaklı Sohu ASIC'i, 8 çiplik bir sunucuda Llama 70B üzerinde saniyede 500.000 token sunduğu bildiriliyor; ancak sabit işlevli devreleri MoE, multimodal veya diffusion modellerini çalıştıramıyor.

Spheron blogunda yayımlanan ve Hacker News'in ön sayfasına taşınan bir yazı, Etched'in Sohu'sunu inceliyor — tek bir 8 çiplik sunucudan Llama 70B üzerinde saniyede 500.000 token, yani çip başına kabaca 62.500 token iddiasındaki, yalnızca transformer odaklı bir inference ASIC'i. Karşılaştırma noktası ise şu: vLLM çalıştıran ve batch size 1'de ölçülen bir H100 SXM5 saniyede yaklaşık 700 token üretiyor. Sohu'yu H100, B200 ve Groq'un LPU'suna karşı kıyaslayan Spheron'a göre bu devasa fark artımlı değil, mimari kaynaklı.
Silikona işlenmiş transformer'lar
Nvidia GPU'ları attention'ı CUDA kernel'ları olarak yürüten programlanabilir cihazlardır — PagedAttention ve FlashAttention gibi optimizasyonların değiştirilebilir yazılım olarak var olmasının nedeni de bu. Groq'un LPU'su ise özel bir derleyiciyle eşleştirilmiş bir dataflow işlemcisi. Spheron, Sohu'yu bu yelpazenin daha uç bir noktasına yerleştiriyor: hedeflenecek programlanabilir bir katman hiç yok. Her transformer katmanının üç işlemi — query, key ve value projeksiyonları, KV cache üzerindeki multi-head attention ve feed-forward ağ — statik devreler olarak kablolanmış. Bu, kernel başlatma gecikmesini, bellek tahsisini ve zamanlayıcı yükünü ortadan kaldırıyor; ama aynı zamanda transformer attention olmayan hiçbir şeyin çip üzerinde çalıştırılamayacağı anlamına geliyor.
Bant genişliği çip üstü SRAM'den değil, HBM3E'den geliyor
Yazı, Sohu'nun decode verimini öncelikle bellek tasarımına bağlıyor. Otoregresif üretim, KV cache'in HBM'den okunmasıyla darboğaza takılır ve H100 SXM5, 80 GB HBM3'ü 3,35 TB/s bant genişliğiyle eşleştirir. Etched'in yayımladığı malzemelere ve sektör haberlerine dayanan Spheron, Sohu'nun çip başına 144 GB HBM3E taşıdığını ve H100'in bant genişliğinin kabaca 1,8 katına sahip olduğunu söylüyor — bu, Groq'un izlediği yolun aksine hâlâ standart çip dışı HBM; Groq'ta ise 500 MB çip üstü SRAM 150 TB/s sunuyor ama bağlam kapasitesini ciddi biçimde sınırlıyor. 144 GB bile 70B ve üzeri parametreli modellerle hızla doluyor, bu yüzden büyük ağırlıklar için çok çipli yapılandırmalar gerekli kalıyor.
Uyumluluk sorunu
Spheron'a göre kısıtlama listesi, manşet hızından daha önemli. Çipin çalıştıramadığı modeller şunlar:
- Kodlayıcıları konvolüsyona dayanan görüntü ve multimodal sistemler, örneğin LLaVA, Qwen-VL ve Llama 3.2 Vision
- U-Net konvolüsyonları üzerine kurulu diffusion görüntü ve video üreteçleri
- Dinamik uzman yönlendirmeli mixture-of-experts modelleri, DeepSeek V4, Mixtral ve Qwen3-235B-A22B dahil; çünkü seyrek uzman seçimi, sabit devrelerin karşılayamayacağı düzensiz bellek erişimi gerektiriyor
- Attention'ı bir tarama (scan) işlemiyle değiştiren Mamba gibi state-space mimarileri
Blog, Nisan 2026 itibarıyla DeepSeek V4 ve Qwen3-235B-A22B'nin en yaygın kullanılan açık ağırlıklı modeller arasında olduğunu belirtiyor; yani bu uç bir örnek değil — üretim inference iş yüklerinin önemli bir kısmı Sohu üzerinde hiç çalışamıyor. Çip ayrıca yalnızca inference için; backward pass olmadığından eğitim ve ince ayar (fine-tuning) dışarıda kalıyor.
İddia edilen rakamlar, imzalanmış sözleşmeler
Saniyede 500.000 token rakamı Etched'in kendi malzemelerinden geliyor, tüm 8 çiplik sunucuya ilişkin ve batch size 1'de ya da ona yakın koşullarda ölçülmüş görünüyor — sabit işlevli devrelerin en yüksek verime ulaştığı, GPU'ların ise token başına bant genişliğini amorti etmek için genellikle batchinge bel bağladığı koşullar. Spheron, bugün bağımsız üçüncü taraf kıyaslamaların, kamuya açık fiyatlandırmanın ya da self-serve kiralamanın bulunmadığının altını çiziyor. İş tablosu daha sağlam: 2022'de kurulan Etched, bildirildiğine göre 5 milyar dolarlık değerlemeyle 500 milyon dolarlık bir tur dahil dört turda toplam kabaca 800 milyon dolar topladı, çalışan A0 silikon gösterdi, yazının güncellemesine göre 30 Haziran 2026'da stealth modundan çıktı, imzalı müşteri sözleşmelerinde 1 milyar doların üzerinde sipariş aldı ve ilk rack sevkiyatlarını 2026 yazı için planladı.
Neden önemli
Sohu, yoğun transformer attention'ın programlanabilirlikten vazgeçmeyi haklı çıkaracak kadar uzun süre baskın inference mimarisi olarak kalacağı yönündeki bir bahis. Eğer karşılığını verirse, sabit işlevli silikon, en büyük LLM iş yükü sınıfı için token başına maliyeti yeniden belirleyebilir. Ama alan MoE yönlendirmesi, multimodalite ya da yeni attention varyantlarına doğru kaymaya devam ederse, çipin hiçbir uyum yolucu yok — CUDA GPU'ları, Groq'un derleyici yığını, AMD'nin ROCm'ü veya Tenstorrent'in açık kaynak TT-Metal'ının aksine. Inference donanımı değerlendiren ekipler için Spheron kararı iş yüküne özgü olarak çerçeveliyor: verimin, araç zinciri geçişine, model desteği sınırlarına ve henüz kimsenin bağımsız olarak test etmediği donanimdaki tedarik riskine değip değmeyeceği.
- #ai-hardware
- #inference
- #asic
- #transformers
- #nvidia