deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Microsoft-Decision-1, agent yönlendirmesi için seçeneklere puan veriyor, Foundry'de milyon token başına 0,042 dolardan yayında

Microsoft, listedeki her seçenek için kalibre edilmiş bir olasılık döndüren, yönlendirme ve agent kararları için tasarlanmış ve milyon girdi tokenı başına 0,042 dolardan fiyatlanan küçük bir model olan Microsoft-Decision-1'i yayınladı.

Microsoft-Decision-1, agent yönlendirmesi için seçeneklere puan veriyor, Foundry'de milyon token başına 0,042 dolardan yayında

Bir sohbet modeli değil, bir puanlama modeli

Microsoft, Microsoft-Decision-1'i 9 Ekim 2026'da yayınladı; tek bir görev için tasarlanmış kompakt bir dil modeli: ona bir durum ve sabit bir seçenek listesi veriyorsunuz, o da listedeki her seçenek için kalibre edilmiş bir olasılık puanı döndürüyor. Satıcının Command Line yayınındaki lansman yazısının dev.to'daki özetine göre model, ilk günden itibaren Microsoft Foundry'de mevcut ve OpenRouter üzerinden erişim planlanıyor.

Model, Qwen3.5-9B'nin tek geçişli karar puanlaması için post-training edilmesiyle oluşturuldu; Microsoft, kendi Microsoft AI modelleri ve OpenAI modelleri dahil diğer temel sistemler üzerine de yeniden inşa edeceğini söylüyor. Microsoft'un CTO Ofisi'nde kıdemli başkan yardımcısı olan Achint Srivastava, bu model sınıfı ile üretken modeller arasında bir çizgi çekti: sohbet modeli metin üretir ya da uçları açık sorunlar üzerinde çalışırken, karar modeli yazılımın hemen üzerinde hareket edebileceği yapılandırılmış çıktı döndürmek için var.

Bu yapı kullanım alanlarını tanımlıyor. Bir destek talebini yönlendirmek, önerilen bir araç çağrısını bir değerlendirme ölçütüne göre denetlemek ve bir yapay zeka yanıtını notlandırmak aynı çağrıya indirgeniyor: bir bağlam, kapalı bir liste ve her öğe için bir puan. Çağıran program eşik değerinin kontrolünü elinde tutuyor; model yalnızca seçenekleri sıralıyor.

Rakamlar, tamamı satıcıdan

Microsoft, yönlendirme, sıralama, uzun bağlam, çok dilli ve dağılım dışı görevleri kapsayan testlerle, yaklaşık 150.000 soruyu içeren 36 benchmark karşılaştırmasında en yüksek doğruluğu bildiriyor. Ayrıca P50 gecikmesinin GPT-6 Sol'den yaklaşık 35 kat daha hızlı olduğunu iddia ediyor. dev.to yazısı, performans ve fiyat rakamlarının bağımsız bir incelemeden değil, Microsoft'un kendi benchmark çalışmalarından geldiğini açıkça belirtiyor.

Windows Report tarafından kaydedilen fiyatlandırma, milyon girdi tokenı başına 0,042 dolardan başlıyor ve çıktı tokenları ücretsiz. Bu oranla, ayda 200.000 gelen mesajı puanlayan bir destek masası girdi için dokuz doların altında ödeme yapıyor; bu da maliyet nedeniyle ekiplerin çoğu zaman atladığı bir denetimi, her mesajda çalıştırılabilecek hale getiriyor.

Microsoft'un gecikme argümanı basit bir aritmetik: 20 ardışık kararın her birine 100 milisaniye eklemek, bir iş akışına iki saniye ekler. Birbirine bağlı adımlardan oluşan agent hatları bu gecikmeyi her durakta devralır.

Beş sorun, ikisi somut rakamlı

Microsoft, çözmesi gereken beş mühendislik sorunu sayıyor: hız, görünmeyen görevlerde de korunan kalite, yeniden ifade edilmiş girdilere karşı sağlamlık, olasılık kalibrasyonu ve güvenlik. Sağlamlık bir rakamla geliyor: model, bir isteği yeniden yazmanın sekiz yolu genelinde ortalama perturbasyonların yüzde 1,3'ünde kararını değiştiriyor; seçenek açıklamaları parafraz edildiğinde ya da seçenekler ters çevrildiğinde veya karıştırıldığında ise hiç sıçrama yaşanmıyor. Kalibrasyon operasyonel terimlerle çerçeveleniyor — yüzde 90'lık bir tahmin, temsili vakalarda on seferde yaklaşık dokuz kez doğru olmalı, çünkü uygulamalar güven seviyesine göre harekete geçme, erteleme veya üst kademeye aktarma kararını veriyor.

Microsoft'un zaten kullandığı yerler

Lansman yazısı dört iç dağıtım anlatıyor. Xbox Research, modeli anketlerden, Steam'den ve Twitter/X'ten gelen 10.000'den fazla uçları açık geri bildirim öğesini, araştırmacıların önceden sabitlediği temalara göre sınıflandırmak için kullandı; Microsoft sonucu, GPT-6 Sol ile kalite olarak rekabetçi ve 14 kattan fazla hızlı ile 200 kat ucuz olarak bildiriyor. Copilot ekibi, sohbet ve agent yanıt kalitesini ölçerken modeli GPT5.6 Luna ile rekabetçi ve 100 kat hızlı buldu. Nöbetçi mühendisler canlı olaylar sırasında bilgi erişimi için kullanıyor. Microsoft Discovery, modeli uyarlamalı yeniden planlama döngüsü içinde denemeleri notlandırmak için kullanıyor ve LLM tabanlı bir notlandırıcıya kıyasla üç kat hızla 46 kat daha tutarlı olduğu bildiriliyor.

Ortak bir örüntü öne çıkıyor: her durumda etiket seti modelden önce var olmuş. Kategorilere veya değerlendirme ölçütüne insanlar karar vermiş; sıralamayı model yapıyor.

Neden önemli

Microsoft-Decision-1, birçok üretim agent yığınının zaten gayri resmi olarak kullandığı bir örüntüyü resmileştiriyor: pahalı bir üreticinin yanında oturan ucuz bir yargıç. Büyük model taslağı yazar; küçük model bundan sonra ne olacağına dair tek bir sınırlı soruyu yanıtlar. Özel bir puanlayıcı, kimsenin okumadığı çıktının üretildiği bir adımdan üretilmiş metni çıkarır; fiyatlandırma da bu denetimi mesaj hacminde karşılanabilir kılar.

Uyarılar öneri kadar net. Her rakam satıcı tarafından bildirilmiş ve Microsoft hiçbir dağıtım prosedürü yayınlamadı; dolayısıyla değerlendirme alıcıda kalıyor: kendi taleplerinizden oluşan etiketli bir set, geçilecek bir referans noktası ve hangi hataların para kaybettirdiğine dair bir görüş — çünkü yanlış bir devam et ile yanlış bir üst kademeye aktar aynı fiyata mal olmuyor. İddialar Microsoft'un kendi testlerinin dışında da doğrulanırsa, bu, model katmanının tek bir modelden üçünü de yapması beklenmek yerine nesil, akıl yürütme ve karar şeklinde uzmanlaşmış katmanlara bölündüğüne işaret ediyor.

  • #microsoft
  • #ai-agents
  • #language-models
  • #microsoft-foundry
  • #machine-learning

İlgili yazılar