· kaynak Hacker News – Front Page (native)
Strands Agents, milisaniyeler içinde yerel olarak çalışan 2B karar modelini açık kaynak yaptı
Strands Agents, seçenekler arasında güven skorlarıyla seçim yapan, tüketici donanımında milisaniyeler içinde yanıt veren ve ağırlıkları ile eğitim verisiyle birlikte sunulan açık kaynak bir karar modeli olan Strands Decider 2B'yi yayınladı.

Strands Agents ekibi, metin üretmek yerine karar vermek için tasarlanmış kompakt bir açık kaynak model olan Strands Decider 2B'yi yayınladı. Strands Agents blogundaki duyuruya göre, 2 milyar parametreli model sunulan seçenekler arasında seçim yapıyor ve basit skorlar atıyor; geliştiricilerin elinde mevcut donanımda hızlı deneme ve yerel geliştirme için optimize edilmiş durumda.
Üretmek yerine karar vermek
Strands Decider, blogun karar modelleri olarak adlandırdığı, system one modelleri olarak da tanımlanan bir kategoriye ait; bloga göre bu sınıf, TypeSafe AI'nin bu ayın başında Jev modelini piyasaya sürmesinden bu yana artan ilgi görüyor. Bu modeller rastgele çıktı üretmek yerine kısıtlı soruları yanıtlıyor: bir ifadenin bir kahve makinesine işaret edip etmediği, bir destek talebini hangi ekibin ele alması gerektiği ya da 0 ile 1 arasında bir duygu skoru gibi.
Ödünleşimler açık. Karar modelleri belirli bir boyutta daha hızlı ve daha yeteneklidir, her zaman seçilen seçeneklerden bir yanıt döndürür ve çok düşük gecikmeyle çalışır. Karşılığında, tüm çıktıları tek bir paralel geçişte üretmek, karmaşık problemlerde onları akıl yürütme modellerinden belirgin biçimde zayıf bırakır; metin üretememeleri ise kodlama, sohbet botları, belge özetleme ve benzeri LLM görevlerini dışarıda bırakır.
Blog iki ek özelliğe daha dikkat çekiyor: her karar, yanıtın ne kadar güvenilir olduğunu gösteren bir güvenilirlik skoru taşıyor (bu, frontier LLM çıkarım API'lerinin sunmadığı bir şey) ve aynı prompt hakkında birden fazla soru sormak verimli.
Kaputun altında
Yapı, önceden eğitilmiş bir Qwen3.5-2B gövdesiyle başlıyor. Dil modeli başlığı (head) çıkarılıyor, bu da metin üretimini elinden alıyor, ve yerini yalnızca bir milyonun biraz üzerinde parametreli bir pointer head alıyor. Bu başlık, her seçenek konumundaki gizli durumu özel bir yanıt konumundaki gizli durumla karşılaştırarak puanlıyor ve gövde, rank-16 LoRA adaptörüyle ince ayarlanıyor.
Yayınlanan model, mimarinin ikinci büyük yinelemesi ve toplamda on dokuzuncu sürümü; daha önceki bir varyant, belirgin biçimde daha kötü performans gösteren bir slot head kullanıyordu ve repository her adımda neyin değiştiğini belgeliyor. Ağırlıklar Hugging Face'te; kod, eğitim verisi ve eğitim scriptleri GitHub'da.
Kıyaslamalar ve gecikme
Ekip, doğruluk ve kalibrasyonu kamu JevBench seti üzerinde birlikte değerlendiriyor ve kalibrasyon için Brier skorunu kullanıyor. Strands Decider 2B, 2B sınıfında 33 model arasında üçüncü, yalnızca-2B'yi-aşan modeller çıkarıldığında 30 model arasında birinci oluyor.
Gecikme tarafında blog, anlamlı sorulara onlarca milisaniye içinde yanıt iddia ediyor; ölçülen sonuçlarsa yerel bir Nvidia RTX 3090 üzerinde yaklaşık 115 ms medyan gösteriyor ve bu süre, token cinsinden görev boyutuyla yaklaşık doğrusal biçimde artıyor. Bir M3 MacBook'ta küçük görevler yaklaşık 153 ms medyanla tamamlanıyor. Model ayrıca JevBench'in kolay görevlerinin yüzde 100'ünü tamamlıyor; ekip bunları ajanların pratikte karşılaştığı rutin kararlara karşılık geliyor.
Neden 2 milyar parametre
Ekip boyut için iki gerekçe gösteriyor. Biri deneme: model mevcut donanımda çalıştırılabiliyor, hatta eğitilebiliyor, bu da denemeleri hızlı ve düşük riskli kılıyor. Diğeri ise tatlı bir nokta: hızlıca üzerinde yinelenecek kadar küçük ama anlamlı işler yapacak kadar büyük.
Nereye oturuyor
Bu sınıf modeller için bildirilen kullanımlar arasında model yönlendirme (routing), araç seçimi, değerlendirme, guardrails, bellek, bağlam yönetimi ve politika sınıflandırması yer alıyor. Blog ayrıca hibrit ajanlara işaret ediyor: bir LLM en zor kararları ele alırken, bir decider modeli maliyeti ve gecikmeyi düşürmek için daha kolay, tekdüze kararları üstleniyor; bunun yanında decider'ların sabit iş akışı dilleriyle eşleştirilmesine yönelik denemeler ile oyunlar, görev otomasyonu ve labirent gezinmede kullanımlar da değiniliyor.
Başlangıç tek bir kurulum: pip install strands-decider. CLI örneğin bir destek şikayetini bir ekibe yönlendirebiliyor; faturalandırmayı perakende ve satışa karşı 0.845 ile puanlandırıyor. Repository ayrıca yerel olarak çalışan, ana model olarak bir Bedrock LLM kullanan ve decider'ı bir guardrail olarak danıştığı bir örnek Strands ajanıyla geliyor: aşırı hevesli bir hava durumu araç çağrısı tetiklenmeden önce decider, argümanların konuşmaya dayanıp basmadığı ve aracı çağırmak için henüz erken olup olmadığı konusunda iki evet/hayır sorusunu yanıtlayarak ajanı, kullanıcının hangi şehri kastettiğini sormaya geri gönderiyor.
Neden önemli
Agentic pipeline'ları, yönlendirme, araç kontrolleri ve güvenlik kapıları gibi nadiren frontier bir model gerektiren kararlarda token ve gecikme harcıyor. Tüketici donanımında yaklaşık yüz milisaniyede yanıt veren ve her yanıta bir kalibrasyon skoru ekleyen 2 milyar parametreli bir decider, bu katman için inandırıcı bir yapı taşı. Sürüm, boyutuna göre alışılmadık derecede eksiksiz: mimari, eğitim verisi, scriptler ve belgelenmiş on dokuz yinelemenin tamamı kamu; başkaları doğrulayabilir, fork'layabilir ve geliştirebilir. Karar modelleri ajan yığınlarının standart bir bileşeni haline gelirse, dizüstü bilgisayarı olan herkesin çalıştırıp yeniden eğitlebileceği açık bir referans uygulama, eşiği ciddi biçimde düşürür.
- #open-source
- #agentic-ai
- #decision-models
- #local-llm
- #machine-learning
İlgili yazılar
- ESP32-C3 DNS ad-blocker, 2 dolarlık kartta flash üzerinden 537 bin domaini susturuyor
- Penguin Mail 1.0.0, takvim ve isteğe bağlı yerel yapay zekâ ile açık kaynak Linux e-posta yazılımı olarak yayımlandı
- AWS, Eylül'de GPU liste fiyatları 15 kez artıp hiç düşmezken Capacity Blocks fiyatlarını %15 yükseltti