deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

TypeSafe AI'nin 'System One' modeli Jev, tek geçişte kalibre edilmiş olasılıklarla yanıt veriyor

TypeSafe AI'nin Jev modeli, tek bir forward pass içinde olasılıkları eklenmiş tipli yanıtlar döndürüyor. Coverage kalibrasyon odaklılığını olumlu karşılıyor ama güvenin kendi veriniz üzerinde ölçülmesi gerektiğini vurguluyor.

TypeSafe AI'nin 'System One' modeli Jev, tek geçişte kalibre edilmiş olasılıklarla yanıt veriyor

TypeSafe AI neyi yayınladı

TypeSafe AI, ilk "System One" modeli olarak nitelendirdiği Jev'i yayınladı. Model sohbet etmiyor, yazmıyor veya adım adım akıl yürütmüyor. Ona bir durum — metin, yapılandırılmış veri veya mesaj geçmişi — artı bir dizi tipli soru gönderiyorsunuz ve model, tek bir forward pass içinde her yanıta eklenmiş bir olasılıkla birlikte eksiksiz yapılandırılmış bir yanıt üretiyor.

Çözümlemenin Hacker News'te öne çıkarıldığı Kartik Pansuriya'nın aktardığı lansman materyaline göre Jev üç soru tipini destekliyor: en fazla 255 seçenek arasından seçim yapan ve seçenek başına bir olasılık döndüren choice; bir girdiyi sıralı düzeylere göre derecelendiren ve sürekli bir puan ile dağılım döndüren score; ve bir ifadenin doğru olma olasılığı olarak döndürülen evet/hayır sorusu olan noul. Bir istekteki tüm sorular paralel değerlendiriliyor, dolayısıyla soru sayısını artırmak gecikmeyi neredeyse hiç değiştirmiyor.

Bu gecikme dikkat çeken sayı: TypeSafe uçtan uca 70–500 ms bildiriyor ve modelin eşdeğer görevlerde frontier LLM'lerden 40 kat ile 200 kat daha hızlı olduğunu iddia ediyor. Perde arkasında Jev, şirketin kalibre edilmiş kararlar için pekiştirmeli öğrenme (RLCD) dediği yöntemle eğitilmiş; belirtilen hedef, sohbet modellerinin aldığı insan tercihi ayarlaması yerine epistemik olarak dürüst olasılıklar. Özellikler kadar sınırlar da dikkat çekici: serbest metin üretimi yok, henüz görüntü girdisi yok, milyon giriş token'ı başına 0,042 dolar fiyatlandırma ile ücretsiz çıkış token'ları ve bekleme listesiyle erişim.

Kalibrasyon tartışması

Pansuriya, hızın daha az ilginç iddia olduğunu savunuyor. Bir pull request'in birleştirilip birleştirilmeyeceğini tahmin ettiği kendi yayınladığı deneyde, bir Random Forest 0,958 F1 puanı alırken çoğunluk sınıfı taban çizgisi 0,957 almış; yararlı bir modeli işe yaramaz olandan ayıran sayı ise 0,676'ya karşı 0,500 olan ROC-AUC olmuş. Dengesiz sorunlarda mevcut doğruluğun çoğu bedavadır; asıl önemli olan sıralama ve güvendir. Aşağı akış mantığı, dediği anlamı taşıyan olasılıklara ihtiyaç duyar: işi %80 güvenin altında manuel incelemeye yönlendiren bir kural, ancak %80 gerçekten %80 ise işe yarar.

Standart düzeltmeler — Platt ölçekleme, izotonik regresyon, sıcaklık ölçekleme — veri değiştiğinde sürüklenen geçici bileşenlerdir. Jev'in bahsi, kalibrasyonun eğitim hedefinin kendisinde yer aldığı yönünde; bu da üretim ML yığınlarından bir yapıştırıcı katmanını çıkarırdı.

plastikelectrik'in dev.to'daki anlatımı temeldeki matematiği ortaya koyuyor. Bir sistem, p güveniyle bildirilen kararların tam olarak p oranında doğru çıkması durumunda kalibre edilmiş sayılır. Doğruluk ve kalibrasyon ayrı eksenlerdir: bir sistem genel olarak %95 doğru olabilir ama yalnızca %60 doğru olduğu çağrılarda %92 güven bildirebilir. Standart tanı araçları, kararları bildirilen güvene göre kovalara ayırıp kova başına gerçek doğrulukla karşılaştıran güvenilirlik diyagramı ile bu açıkların ağırlıklı ortalaması olan Beklenen Kalibrasyon Hatası'dır (ECE). Yazar kaba bir saha rehberi olarak, üretim karar sistemi için yaklaşık 0,03–0,05 altındaki bir ECE'nin iyi kalibre edilmiş sayıldığını, 0,1 üzerindeki her değerinse güven alanını onu tüketen her şey için aktif yanıltıcı hale getirdiğini öneriyor.

Nereye oturuyor ve şüphecilik nereye düşüyor

Toptan dağıtımda ML üzerinde çalışan Pansuriya, Jev'in bir LLM'nin aslında sohbet kılığına girmiş sınıflandırma yaptığı her yerde — istisna eleme, ürün kategorileme, aciliyet puanlama — ve elle yazılmış anahtar kelime kurallarının dağınık serbest metinlerde sürekli bozulduğu her yerde uygun olduğunu görüyor. Yaklaşık 100 ms içinde kullanılabilir bir güvenle verilen bir karar, bir kuyrukta yanında değil bir istek yolunun içinde konumlanabilir. Üretim veya optimizasyon içinse Jev yanlış araç; bunu TypeSafe'in kendisinin de söylediğini belirtiyor.

Coverageda üç uyarı öne çıkıyor. Birincisi, "sıfır halüsinasyon" iddiası en iyi şu şekilde okunur: geçerli çıktı tipleri garantisi — beş kategoriden birini isteyin ve olasılıkları bire toplanan beş kategoriden birini alırsınız; ama geçerli bir şemadaki kendinden emin bir yanlış yanıt yine yanlıştır. İkincisi, kalibrasyon bir modelin ve bir veri kümesinin özelliğidir. İki kaynak da burada buluşuyor: plastikelectrik, TypeSafe dahil kimsenin size entegrasyonunuzun %90'ının dürüst bir %90 olduğu garantisi veremeyeceğini yazıyor ve kriter sürüklenmesini yanlış kalibrasyonun tekrarlayan nedenleri arasında sayıyor. Üçüncüsü, hız karşılaştırması tartışmalı biçimde çarpıktır: birçok böyle görev için ilgili taban çizgisi bir LLM değil, aynı zamanda hızlı ve ucuz olan gradyan artırmalı bir ağaçtır. Pansuriya üçlü bir karşılaştırma istiyor — klasik tablo modeli, sınıflandırıcı olarak LLM ve Jev — doğruluk, sıralama, kalibrasyon, gecikme ve maliyet açısından; ve bunu kendi PR kabul test yatağında çalıştırmayı planlıyor.

Neden önemli

Jev'in olasılıkları TypeSafe'in benchmark'ları dışındaki verilerle temasda hayatta kalırsa, ML çıkarımının ekonomisini değiştirir: güvenilir güvenle hızlı tipli kararlar, hem kırılgan kuralların hem de aşırı nitelikli LLM çağrılarının yerini alabilir ve modelleri toplu işlerden canlı istek yollarına taşıyabilir. Hayatta kalamazsa, başarısızlık sessiz olur; çünkü doğruluk metrikleri bunu ortaya çıkarmaz ve güven kapılı yönlendirme, eşiklerinin ima ettiğinden daha riskli trafiği sessizce onaylar. Her durumda yük entegratörlere geçer: kararları kaydedin, gerçek değerleri toplayın ve bir modelin size verdiği herhangi bir sayıya güvenmeden önce kendi trafiğinizdeki kalibrasyon hatasını ölçün.

  • #ai
  • #machine-learning
  • #calibration
  • #classification
  • #llm

İlgili yazılar