· kaynak dev.to (home feed)
Kinetic-4B, tool-calling benchmark'ında Claude Haiku 4.5 ve GPT-OSS-120B'yi geride bıraktı
Bengaluru'daki Conscious Engines laboratuvarının 4 milyar parametreli açık modeli, 300 örnekli bir tool-calling değerlendirmesinde %82,33 skor alarak doğrulukta Claude Haiku 4.5'i geçti ve kuyruk gecikmesini 2,5 kat düşürdü — ancak bu, kendi yayınladığı bir benchmark.

4B'lik bir model dar bir yarışı kazanıyor
Kinetic-4B adlı dört milyar parametreli açık model, bir tool-calling benchmark'ında Anthropic'nin Claude Haiku 4.5'ini ve OpenAI'nin GPT-OSS-120B'sini geride bırakırken, ikisinden de çok daha hızlı yanıt verdi. Bengaluru'daki Conscious Engines laboratuvarının 1 Nisan 2026'da yayınladığı bir değerlendirmeyi özetleyen dev.to yazısına göre Kinetic-4B, 300 örnekli bir testte %82,33 doğruluğa ve 1,61 saniyelik bir p95 gecikmeye ulaştı. Claude Haiku 4.5, %80,0 skor ve 4,02 saniye; yaklaşık 30 kat fazla parametreye sahip GPT-OSS-120B ise %76,33 ve 7,99 saniye ile tamamlandı.
Manşetteki doğruluk farkı küçük. Başarısızlık oranı ise öyle değil: aynı yazıya göre Kinetic-4B'nin çağrılarının %4,67'si başarısız olurken Haiku 4.5'te bu oran %9,67. Agent pipeline'larında başarısız bir çağrı, yakalanıp yeniden denenmesi gereken hatalı veya kullanılamaz bir istektir ve her yeniden deneme, bir adım zinciri boyunca gecikmeyi katlar. Bu oranı yarıya indirmek, bir agent geliştiricisinin yazması gereken hata yönetimi miktarını değiştirir.
Değerlendirme nasıl kuruldu
Test seti, GitHub, Slack, Salesforce, Stripe, Notion ve Jira dahil 800'den fazla entegrasyonu kapsayan bir agent araç-entegrasyon platformu olan Composio'dan 300 örnek aldı. Her prompt, on aday araç sunuyordu — bir doğru cevap artı aynı toolkit'ten alınan dokuz çeldirici; bu da neredeyse aynı olan bir aracı seçme şeklindeki gerçek dünyadaki başarısızlığı yansıtıyor. Tüm modeller aynı örnekleri, aynı seed'i ve aynı tool_choice=auto ayarını gördü.
Sonuç tablosundaki bir satır hikâyeyi dengeliyor. Kinetic-4B'nin fine-tune edildiği değiştirilmemiş temel model olan Qwen3-4B-Instruct-2507, tek başına zaten %78,67 skor almıştı. 300 örneğin 222'sini hem temel hem de fine-tune edilmiş model doğru yanıtladı; fine-tune 25 örneği düzeltirken 14'ünü bozdu — net kazanç on bir. Başka bir deyişle, yeteneğin büyük kısmı zaten açık temel modelin içinde duruyordu.
Kiralık tek GPU, dört buçuk saat
Sonucun arkasındaki eğitim çalışması mütevazıydı. Conscious Engines, 64 rank ve 128 alpha değerleriyle tüm projeksiyonlarda LoRA kullandı; 2e-4 öğrenme oranıyla iki epoch boyunca 132 milyon parametre — toplam 4,15 milyarın yaklaşık %3,18'i — eğitti. Çalışma, Composio'nun ilk 20 toolkit'inden, aynı bir-doğu-artı-dokuz-çeldirici yapısıyla oluşturulmuş 13.694 örneklik bir veri seti kullanarak tek bir kiralık GPU'da yaklaşık 4,5 saat sürdü.
Genel amaçlı function-calling verisiyle yapılan daha önceki bir tam fine-tune denemesi yalnızca yaklaşık %71 başardı; bu, dokunulmamış temel modelin bile altında bir skor. Temel ağırlıkları dondurup düşük ranklı bir güncellemeyle adaptasyon yapmak, tam fine-tune'un aşındırdığı talimat takibini korudu — aktarılabilir ders şu: güçlü bir temel üzerindeki dar görevler için LoRA daha güvenli bir varsayılan seçenek.
Hugging Face'te consciousengines/Kinetic-FC-LoRA olarak yayınlanan adapter, Qwen3-4B-Instruct-2507'nin üzerine uygulanıyor; böylece model güvene dayanarak değil, yeniden üretilerek doğrulanabiliyor.
Arkasında kim var
Conscious Engines, Bengaluru'daki Indiranagar'da faaliyet gösteriyor ve Ethereum ölçeklendirme şirketi Stackr Labs'tan gelme Kautuk Kundan tarafından kuruldu. Laboratuvar a16z tarafından destekleniyor ve kurucunun kamuya açık açıklamaları yıllıklaştırılmış geliri 1 milyon dolar civarına koyuyor. Kinetic-4B çalışması bir LossFunk rezidansından çıktı ve Ritam Pal ile birlikte hazırlandı.
Laboratuvarın ticari tezi, her kullanım senaryosuna göre özelleştirilmiş modeller; sınır modelleri ise sevilecek ürün değil, damıtma için öğretmen olarak hizmet veriyor. Maliyet konusunda dev.to yazısı, Haiku 4.5'in milyon giriş başına 1 dolar ve milyon çıktı token'ı başına 5 dolar listelendiğini, bunun mutlak anlamda ucuz olduğunu belirtiyor; Conscious Engines ise %75-80 aralığındaki büyük kurumsal indirimlerin gerçek birim maliyeti bulanıklaştırdığını ve lock-in'i teşvik ettiğini savunuyor. Kurucu ayrıca, yerel bir modelin sıfır marjinal maliyetle çalıştırdığı bir göreve API token'larında yaklaşık 35 dolar harcadığını anlattı; ancak bu, ölçülmüş bir karşılaştırma değil, kendisi tarafından aktarılmış bir anekdot.
Sonucun geçerli olmadığı yerler
Üç uyarıyı açıkça belirtmek gerekir. Değerlendirme, tek bir 300 örneklik set; sonucunda çıkarı olan bir taraf tarafından kendi kendine yayınlandı ve bağımsız olarak tekrarlanmadı. Tek bir yeteneği ölçüyor — Anthropic, Haiku 4.5 için SWE-bench Verified'da %73,3 bildiriyor ve bir tool router bir kodlama modeli değildir. Ve dokuz çeldiricili tasarım, Kinetic-4B'nin eğitildiği kurulumla örtüşüyor; oysa üretim trafiği daha dağınıktır.
Neden önemli
Agent geliştiricileri için pratik çıkarım routing: yapılandırılmış, tekrarlayan tool çağrılarını küçük bir fine-tune edilmiş modele yönlendirin, belirsiz her şey için arkasında genel bir model bulundurun ve başkalarının tablosuna güvenmek yerine kendi p95'inizi ölçün. Sonuç ayrıca dar bir yeteneğin ne kadar ucuzladığını — kiralanmış tek GPU'nun bir öğleden sonrası — ve bu yeteneğin ne kadarının zaten açık temel modellerde, kilidinin açılmasını beklediğini gösteriyor.
- #tool-calling
- #small-language-models
- #open-source
- #fine-tuning
- #benchmarks
İlgili yazılar
- DeepSeek V4.1-Flash'ın kodlama alanında Claude Opus 5 ile berabere kaldığı, token maliyetininse çok daha düşük olduğu bildiriliyor
- Kuzu kullanımdan kaldırıldı: Graphiti agent memory'yi LadybugDB ve Ollama ile tek bir dosya üzerinde çalıştırmak
- Jev demistifiye edildi: teknik analizler, hype yapılan 'System One' modelinin özünde bir classifier olduğunu savunuyor