· kaynak Hacker News – Front Page (native)
InstinctFlash: açık kaynak runtime, 5B world-action modellerini Jetson Thor ve RTX GPU'larda çalıştırıyor
General-Instinct, sekiz robotik model ailesi için InstinctFlash adlı bir serving runtime'ını açık kaynak yaptı; 5B world-action modelleri Jetson Thor, RTX 4090 ve RTX 5090 donanımında çalışıyor.
General-Instinct, InstinctFlash'ın tüm kaynak kodunu yayımladı; Show HN başlığında robotik modeller için bir serving runtime'ı olarak tanıtılan proje, NVIDIA'nın Jetson Thor modülü üzerinde 5 milyar parametrelik world-action modellerini gerçek zamanlı çalıştırdığını iddia ediyor. Proje 22 Eylül'de Hacker News'in ana sayfasına çıktı ve bağlantı verilen GitHub deposundaki changelog, tüm kaynak kodunun yayımını 15 Eylül 2026 olarak tarihliyor; bunu 16 Eylül'de RTX 4090 desteği ve 17 Eylül'de RTX 5090 desteği izledi.
Ne çalıştırıyor
Depoya göre tek bir Runtime API, sekiz robotik model ailesini kapsıyor: LingBot-VA (5B world-action modeli), LingBot-VLA-4B, LingBot-VLA-V2-6B, LeRobot ekosisteminden pi0.5, NVIDIA'nın GR00T N1.7-3B'si, NVIDIA'nın Cosmos3 Edge ve Nano DROID politikaları ile DreamZero. Fine-tune edilmiş checkpoint'ler beklenen durum olarak ele alınıyor: instinctflash serve komutunu bir eğitim çıktısına yönlendirmek, aracın aileyi algılamasını, checkpoint'in kendisinin kanıtladığına dayalı küçük bir JSON bildirimi yazmasını ve serving'i başlatmasını sağlıyor. Checkpoint'in kanıtlayamadığı her şey tahmin edilmeden açıkça talep ediliyor.
Benchmark sayıları
Öne çıkan iddia, Jetson Thor üzerinde LingBot-VA ile 33.78x'e varan hızlanma; geliştiriciler gerçek robot testlerinde görev performansı kaybı görmediklerini söylüyor. Ancak depo, bu rakamın örnekleme programının 25V/50A'dan 2V/4A'ya indirilmesini de içerdiğini açıkça belirtiyor. 15 Eylül 2026'da Jetson Thor üzerinde ölçülen birebir karşılaştırılabilir p50 tahmin gecikmeleri, tablo genelinde daha küçük ama yine de büyük kazançlar gösteriyor:
- pi05 (FP8): 408.58 ms'den 51.85 ms'ye, 7.88x
- LingBot-VA (FP8, tam 25V/50A programı): 15,506.32 ms'den 2,891.74 ms'ye, 5.36x; 2V/4A'da 2,071.29 ms'den 459.10 ms'ye, 4.51x
- Cosmos3 Edge DROID (sayısal çözücü değişiklikleri): 3,393.78 ms'den 1,048.01 ms'ye, 3.24x
- LingBot-VLA-4B (FP8): 624.22 ms'den 221.53 ms'ye, 2.82x
- Cosmos3 Nano DROID: 10,184.68 ms'den 4,772.38 ms'ye, 2.13x
- DreamZero DROID (FP8, 16 adım, dinamik cache): 23,563.08 ms'den 11,899.42 ms'ye, 1.98x
- LingBot-VLA-V2-6B (FP8): 734.56 ms'den 394.11 ms'ye, 1.86x
- GR00T N1.7 (yalnızca bit-exact dönüşümler): 139.50 ms'den 117.30 ms'ye, 1.19x
Hassasiyet değişiklikleri opt-in
Öne çıkan tasarım kararı hassasiyet politikası. Runtime, bit-exact dönüşüm tavanı altında yerel hassasiyette varsayılan olarak çalışıyor; yani yalnızca sayısal sonuçları değiştirmeyen dönüşümler otomatik uygulanıyor. FP8 quantization, sayısal derleme ve azaltılmış adım programları, precision ve tier-ceiling ayarları üzerinden açık opt-in seçenekler; DreamZero'nun dinamik adım cache'i ise ayrı bir davranışsal tier arkasında duruyor. Çıktıları değiştirebilecek her hızlandırma, sessiz bir varsayılan değil, açıklanmış bir tercih.
Serving, doğrulama ve yeniden üretim
Ağ üzerinden serving, pi0/openpi ekosisteminin zaten konuştuğu WebSocket üzerinden msgpack protokolünü kullanıyor; böylece openpi-client üzerine kurulu mevcut robot taraflı istemciler değişiklik gerektirmeden bağlanabiliyor. Operasyonel bayraklar pratik: ağırlıklara da GPU'ya da ihtiyaç duymayan bir dry-run ön kontrolü, bir model yükleyip tek bir aksiyon üreten bir smoke modu, eşleştirilmiş karşılaştırmalar için seed desteği (FP8 altında reddediliyor) ve gözlemlerin, aksiyonların ile gecikmelerin bir Rerun görüntüleyicisine akıtılması.
Bir validate fiili, bir checkpoint'in yayımlanabilir olup olmadığını kontrol ediyor ve öğretmen ile öğrenci sonuçlarına karşı açık bir marjla üstün olmadığından (non-inferiority) emin olabiliyor, sertifikayı paketin içine damgalıyor. Bir eval fiili, gecikme, aksiyon uyumu ve simülatör görev başarısını ayıran raporlar üretiyor; eşleştirilmiş LIBERO ve RoboTwin deneyleri için kılavuzlar da var. Benchmark yeniden üretim betikleri denetlenmiş JSON/CSV raporları ve tam aksiyon dizileri üretiyor; bir serving smoke testi ise gerçek CLI ve WebSocket hattını çalıştırıyor.
Kurulum katmanlı: PyTorch'a veya GPU'ya ihtiyaç duymadan checkpoint'leri inceleyip planlar yapan Python 3.10+ çekirdeği ile çıkarım, aile başına sabitlenmiş ortamlarda çalışıyor — çoğu aile için Python 3.12, Cosmos3 Edge ve Nano için 3.13 — ve upstream kaynaklar ile uyumluluk yamalarıyla önyükleniyor. Model ağırlıkları ayrı indiriliyor.
Neden önemli
Vision-language-action ve world-action modelleri, genel amaçlı robot kontrolünde güncel yön; ancak boyutları, edge çıkarımını darboğaz haline getiriyor: tahmin başına saniyeler gerektiren bir politika, bir kontrol döngüsünü kapatamaz. Jetson Thor ile tüketici GPU'larını kapsayan, tek bir API ile sekiz model ailesini barındıran bir runtime, bu checkpoint'leri fine-tune eden laboratuvarlara, aksi halde model başına kendilerinin inşa etmek zorunda kalacağı serving altyapısını veriyor. Quantization'ı açık, denetlenebilir bir tercih olarak ele almak ve üstün olmadığını sertifikalayan araçlar sunmak, standart 'daha hızlı ama daha mı kötü?' itirazını önceden bertaraf ediyor. Uyarılar gerçek: tüm rakamlar projenin kendi ölçümleri ve 33.78x'lik öne çıkan rakam bir örnekleme programı değişikliği içeriyor. Ancak yayımlanmış ham sonuçlar ve yeniden üretim komutlarıyla bağımsız doğrulama en azından mümkün — çoğu serving çerçevesi lansmanının sunduğundan fazlası.
- #robotics
- #edge-ai
- #open-source
- #inference
- #jetson-thor