· kaynak Hacker News – Front Page (native)
Cactus, cihaz içi tool call'ler için tasarlanmış 8-29MB'lık Needle 3 modelini yayınladı
Cactus, tek bir 8-29MB'lık binary olarak sunulan ve mobil tool calling'de çok daha büyük sistemleri geride bıraktığını iddia eden, telefonlardan mikrodenetleyicilere kadar tamamen cihaz üzerinde çalışan 29-121M parametreli Needle 3 modelini yayınladı.
Cactus ne duyurdu
Cactus, tek bir 8-29MB'lık binary olarak sunulan ve telefonlarda, giyilebilir cihazlarda, robotlarda, akıllı ev cihazlarında, otomobillerde ve mikrodenetleyicilerde yerel olarak çalışmak üzere tasarlanmış Needle 3 adlı bir foundation modeli yayınladı. Duyuru şirket sitesinde yayınlandı ve Hacker News'te Show HN gönderisi olarak öne çıktı.
Şirket, genel sohbet yeteneğini bilinçli olarak otomasyon performansı lehine feda ettiğini belirtiyor: model, uçsuz bucaksız sohbet için değil, tool call'ler, yapılandırılmış veri çıkarma (extraction) ve text embedding için tasarlandı. Cactus'a göre bu daha dar işlerde Needle 3, mobil tool calling'de kendisinin on katı büyüklüğündeki sistemleri geride bırakıyor ve extraction'da iki-üç kat daha büyük modellerle eşit performans gösteriyor; ayrıca ince ayar yapılmış (fine-tuned) 4 katmanlı bir alt ağın, downstream görevlerde DeepSeek V4 Flash'a ulaşabildiğini söylüyor.
Tek bir ağırlık seti, yirmi boyut
Tasarımın merkezindeki fikir, Cactus'ın intelligence laddering dediği yaklaşım. Modelin her katmanı, kapasitesi monoton biçimde artan bir alt ağ (sub-network); böylece geliştiriciler aynı ağırlıkları 2 katmanlı bir modelden 20 katmanlı bir modele kadar her boyutta kullanabiliyor ve her basamak bağımsız olarak fine-tune edilebiliyor. Bir giyilebilir uygulama küçük, ayarlanmış bir alt ağ yayınlarken bir telefon tüm yığını kullanabilir.
Perde arkasında Needle 3, geleneksel bir transformer değil, 29-121M parametreli bir Laddered Simple Attention Network; Cactus'ın CQ2 dediği 2-bit formata quantize edilmiş. Eğitimde 360B token'lık özel mülk yapılandırılmış veri kullanıldı. Cactus, Raspberry Pi 5 üzerinde saniyede 400-4.000 token decode ve saniyede 1.000-10.000 token prefill hızları raporluyor ve mimarinin aynı konfigürasyondaki bir transformer'ın token başına MFLOP'larının yarısından azını kullandığını iddia ediyor.
Üç görev: çağrılar, extraction, embedding
Tool calling'de model, bir uygulamanın sunduğu fonksiyonları okuyor, doğru olanları seçiyor ve argümanları kullanıcının söylediklerinden dolduruyor. Cactus'a göre çok amaçlı istekler sırayla birden fazla çağrı üretiyor ve hiçbir aracın kapsamadığı bir istek, tahmini bir çağrı yerine boş bir liste döndürüyor.
Extraction'da geliştirici bir şema tanımlıyor — Python paketinde bir Pydantic modeli — ve bir fatura, rezervasyon ya da bildirim gibi dağınık bir metni verip tiplendirilmiş alanlar geri alıyor. Bir decode grammar'ı çıktının ayrıştırılabilir olmasını garanti ediyor ve Cactus bu yeteneğin sınıflandırma görevlerine de iyi aktarıldığını söylüyor.
Aynı ağırlıklar ayrıca cümle embedding'leri üretiyor; bu sayede cihaz üzerinde anlamsal arama, bir sorguyu birçok araç arasından en uygun olana yönlendirme ve neredeyse aynı uyarıları birleştirme, hiçbir veri donanımdan çıkmadan yapılabiliyor.
Güvenlik mekanizmaları ve fine-tuning
Python paketi araç tanımları olarak imzalara ve docstring'lere dayanıyor: bir fonksiyonu dekore edin, run() çağırın; motor çağrıyı seçer, çalıştırır, sonucu geri besler ve nihai yanıtı döndürür. Bir açıklama her ifade biçimini sıralayamadığında, regular expression tetikleyicileri bir isteği adı verilen bir araca yönlendirebilir; decode işlemi eşleşen araçlarla sınırlandırılır ve bir çağrı zorunlu kılınır.
Her yanıt, kalibre edilmiş bir kafadan gelen bir güven skoru taşıyor. 0,1 eşiğinin altında çağrılar çalıştırılmak yerine suppressed_calls alanına alınıyor; üstünde ise geliştiriciler skora göre yönlendirme yapabiliyor — yüksekse hemen harekete geçmek, ortadaysa onay istemek. Cactus ayrıca, bir turdaki her ekstra aracın yanlış yönlendirme olasılığını artırdığından, dar kapsamlı ve sade biçimde tanımlanmış araçlar öneriyor.
Özelleştirme için geliştiriciler donmuş temel model üzerinde 20 katmanın tümünde LoRA fine-tuning çalıştırabiliyor ve herhangi bir alt ağ için 4-bitlik bir dosya dışa aktarabiliyor. Ücretli Cactus Platform ise veri seti yönetimi, değerlendirme takibi ve şirket altyapısında tam fine-tune imkanı ekliyor. Her dağıtım hedefi, başlangıçta needle3.cact ağırlıklarını yükleyen 1MB altında bir önceden derlenmiş motor sunuyor; inference motoru Hugging Face'ten çekilip ilk kurulumda önbelleğe alınıyor.
Benchmark'ları dikkatle okuyun
Performans iddiaları Cactus'a ait ve duyurulan metodoloji farklı serving kurulumlarını bir arada kullanıyor: Needle alt ağları, sevkedilen 2-bit binary'lerle puanlanırken baseline'lar vLLM altında f16 ile, DeepSeek V4 Flash ise bulut API'si üzerinden çalıştırılmış. Cactus, DroidCall veri seti üzerinde yapılan fine-tuning'in her alt ağı 18 ila 36 puan yükselttiğini, 4 katmandan (yaklaşık 29M parametre) yukarı tüm ayarlanmış modellerin DeepSeek V4 Flash'ı geçtiğini raporluyor. Bu rakamlar henüz bağımsız olarak doğrulanmadı; bu nedenle üçüncü taraf değerlendirmeler ortaya çıkana kadar öne çıkan karşılaştırmalara satıcı benchmark'ı olarak yaklaşın.
Neden önemli
Needle 3, faydalı yapay zekâyı bulut yerine cihaz üzerinde çalıştırma çabasının tam ortasında duruyor; bu, çevrimdışı çalışma, daha düşük gecikme, istek başına API maliyeti olmaması ve donanımdan asla çıkmayan veri demek. Laddering kavramı ilginç mühendislik bahsi: tek bir eğitim çalışması, bir mikrodenetleyiciden bir telefona uzanan bir model ailesi üretiyor ve bir ürün hattı, doğruluk gereksinimleri arttıkça merdiveni tırmanabiliyor. Yayın ayrıca küçük modellerin nasıl değerlendirildiğindeki daha geniş bir kaymayı da yansıtıyor — genel sohbet yeteneğine göre değil, görev odaklı bir uzmanın dar bir işte çok daha büyük bir genelciye eşit olup olamayacağına göre. Rakamların tutup tutmadığını bağımsız değerlendirme belirleyecek; ancak ürünün biçimi — küçük, quantize edilmiş, embedding yetenekli, tool-öncelikli — mobil ve gömülü yapay zekânın açıkça yöneldiği noktayı işaret ediyor.
- #on-device-ai
- #small-language-models
- #edge-computing
- #tool-calling
- #quantisation