· kaynak Hacker News – Front Page (native)
OpenTPU: Yapay zeka ajanları gerçek dil modellerini çalıştıran açık kaynak bir hızlandırıcı tasarladı
Yapay zeka ajanlarının geliştirdiği açık söylendiğine göre, openTPU; RTL, ISA, simülatör ve derleyiciyi tek bir repo'da birleştiren açık kaynak bir hızlandırıcı. Bir Kintex-7 FPGA kartında on modeli çalıştırıyor ve simülatörüyle bit bit aynı sonuçlar üretiyor.
Yapay zeka ajanları hızlandırıcı yığınının tamamını kurdu
GitHub'da FeSens hesabı altında barındırılan ve Hacker News ana sayfasında öne çıkan openTPU adlı proje alışılmadık bir yazarlık iddiasında bulunuyor: hızlandırıcı yığınının tamamı yapay zeka ajanları tarafından geliştirildi. Repoya göre bu yığın; SystemVerilog ile yazılmış çip tasarımının kendisi, instruction set, bit düzeyinde doğru (bit-exact) bir Python simülatörü, kendi derleyicisi olan bir kernel dili ve gerçek bir PCIe kartını süren host yazılımını kapsıyor. Proje kendisini auto-arch-tournament adlı önceki bir çalışmanın uzantısı olarak konumlandırıyor ve iki soru soruyor: ajanlar donanım tasarımında ne kadar ileri gidebilir ve kendi çıkarımlarını (inference) çalıştıran çipi inşa edebilirler mi?
Repo aynı zamanda bir öğretim materyali. Her şey, Python'daki bir matris çarpımından tellere kadar baştan sona okunması amaçlanan tek bir monorepo'da yaşıyor; host tarafında ise otpu-chat, otpu-smi ve otpu-lens adlı chat, izleme ve profil araçları bulunuyor.
FPGA kartında doğrulanmış sonuçlar
Tasarım simülasyonla sınırlı değil. Projenin sayfasına göre, iki DDR3 kanallı Xilinx Kintex-7 xc7k480t FPGA taşıyan Inspur YPCB-00338 kartında, gerçek ağırlıklarıyla on güncel model çalışıyor ve kart, test edilen tüm konfigürasyonlarda simülatörle bit bit aynı token'ları üretiyor.
Verim mütevazı ama tutarlı. int8'de LFM2.5-230M saniyede 59.0 token, Qwen3-0.6B 21.6 ve Qwen3.5-0.8B 17.6 token çözüyor; daha büyük modeller tek haneli hızlara düşüyor: Phi-4-mini (3.8B) 3.99, Gemma 4 E4B 3.78. Dört bitlik ağırlıklar decode verimini yaklaşık yüzde 40-45 artırarak LFM2.5-230M'yi saniyede 85.8 token'a taşıyor. Decode sırasında kart, 17.1 GB/s'lik DDR3 zirvesinin yüzde 82 ile 94'ünü sürdürüyor; proje bunun nedeninin decode'un bellek bant genişliğine bağlı olması olduğunu belirtiyor. 2026-09-29 ile 2026-10-01 arasına tarihlenen ölçümlerde, tüm modelleri kapsayan tek bir bitstream içeren 133.33 MHz'lik image kullanıldı ve sistem, Intel Core i7-4790 etrafında kurulu bir makinede çalıştı.
Bilinçli olarak sade bir mimari
Makine karmaşıklıktan bilerek kaçınıyor. Bir sequencer her çevrimde tek bir instruction, her instruction ise sekiz 32-bit sözcükten oluşan komutları birkaç birime iletiyor: bir DMA motoru, DRAM'den akan int8 ağırlıkları çarpan dört sütunlu sistolik matris birimi, bir fp32 vektör birimi ve sonuçları tekrar int8'e dönüştüren bir quantizer. Cache yok, gizli zamanlama yok; her veri hareketi açık bir instruction olduğu için bir trace, çevrimlerin tam olarak nereye gittiğini gösteriyor. Bellek denetleyicileri, bellek çekirdeğindeki küçük bir CPU tarafından başlangıçta on iki saniyede, host'un hiç katılımı olmadan kalibre edilen LiteDRAM örnekleri.
Quantization ve expert offload menzili genişletiyor
Dört bitlik ağırlıklar, iki düzeyli blok ölçekleriyle FP4 değerleri kullanıyor ve ağırlık başına 4.25 bite denk geliyor; doğruluk için dil modelinin head kısmı int8'de tutuluyor. Proje, bunun model başına belgelenmiş, ölçülebilir bir perplexity maliyetiyle token başına baytları yaklaşık üçte bir azalttığını bildiriyor.
Kartın 4 GiB belleğinden büyük Mixture-of-experts modelleri, expert'ler host depolamadan akıtılıarak çalışıyor. LFM2.5-8B-A1B (8.5B parametre, 1.7B aktif) saniyede 10.6 token çözüyor ve expert kullanımlarının yüzde 98.5'i kart üzerindeki slotlara denk geliyor; Qwen3.5-35B-A3B saniyede 3.95 token'a ulaşıyor ve PCIe üzerinden token başına 153 MB veriyi 1.41 GB/s hızında akıtıyor. Her iki konfigürasyon da simülatörle bit bit aynı. Host'un katılımı bu dışında neredeyse yok: bazı modellerde kart önceden derlenmiş tek bir decode programını çalıştırıyor, host token başına yalnızca 0.17 ile 0.30 milisaniye ekliyor.
Neden önemli
Donanım tasarımı, otomasyona yazılımdan daha inatçı bir direnç gösterdi ve bu proje yazarlığı ajanlara atfederken dikey yığının tamamını kapsıyor: yalnızca RTL üretimi değil, simülasyon ile fiziksel silikon arasında bit bit tutarlı bir ISA, derleyici, simülatör ve host araçları. İddia inceleme altında ayakta kalırsa, bu yapay zeka ajanlarının hızlandırıcı tasarımının gerektirdiği katmanlar arası kısıt karşılamasını başarabileceğinin kanıtı olur.
Pratik yan da önemli. On yıllık bir CPU ile raflardan alınmış bir FPGA kartı, 35B'ye kadar parametreli modelleri çalıştırıyor ve tasarımın tamamı açık ve okunabilir; bu da onu inference donanımının gerçekte nasıl çalıştığını öğrenmek isteyenler için uçtan uca nadir bir referans yapıyor.
Uyarılar gerçek: yapay zeka yazarlığı iddiası projenin kendi tanımına dayanıyor, decode hızları ticari hızlandırıcıların çok altında ve sonuçlar bağımsız olarak doğrulanmış değil. Yine de, donanım-yazılım sınırında görev yapan ajanların bir gösterimi olarak openTPU önemli bir kilometre taşı.
- #ai-agents
- #fpga
- #open-source-hardware
- #llm-inference
- #chip-design