deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak TechCrunch

Eski OpenAI araştırmacısının Jev'i metin değil karar üretiyor ve geliştiricilerin gönlünü kazanıyor

ChatGPT ve RLHF üzerinde çalışan erken dönem bir araştırmacının kurduğu TypeSafe AI'nin Jev modeli düz metin yerine kalibre edilmiş olasılıklar döndürüyor — canlı Pong demosunda ortalama 227ms ile chat modellerinin saniyelerine karşı.

Eski OpenAI araştırmacısının Jev'i metin değil karar üretiyor ve geliştiricilerin gönlünü kazanıyor

Diogo Almeida — ChatGPT üzerinde çalışan ve insan geri bildiriminden pekiştirmeli öğrenmenin (RLHF) geliştirilmesine yardımcı olan eski bir OpenAI araştırmacısı — tarafından kurulan TypeSafe AI, kasıtlı olarak konuşmayan transformer tabanlı bir model olan Jev'i yayınladı. Jev metin üretmek yerine, olası cevapları geliştiricinin önceden tanımladığı görevler için şirketin "kalibre edilmiş kararlar" olarak markalaştırdığı olasılıklar döndürüyor. TechCrunch'a göre geliştirici ilgisi o kadar yoğundu ki şirket, lansmanın hemen ardından API trafiğini sunma kapasitesini kısa süreliğine kaybetti.

Halüsinasyon üretemeyen bir model

Bu tasarım tercihinin pratik sonuçları var. TechCrunch'ın belirttiği gibi, çıktı alanı kullanıcı tarafından önceden sabitlendiği için model, dil modellerinin yaptığı şekilde halüsinasyon üretemiyor:事实 uyduracak serbest biçimli bir metin yok. Ayrıca çalıştırması da ucuz — çıktı token'ları hiçbir şeye mal olmuyor ve girdi token'ları milyonla değil milyarla ölçülüyor.

TypeSafe, Jev'i adım adım akıl yürütme yerine hızlı sezgiye odaklanan bir "System One model" olarak tanımlıyor. Ad, 19. yüzyıl ekonomisti William Stanley Jevons'a bir gönderme; onun paradoksuna göre bir emtia ucuzladıkça toplam tüketimi eğilim olarak artar. Almeida'nın açıkladığı bahis, kararların düşen maliyetinin zekâyı birkaç büyük chatbot'ta yoğunlaştırmak yerine çok sayıda küçük yazılım parçasına yayacağı yönünde.

227 milisaniye neye benziyor

Hız farkının en canlı örneği, Hacker News'in ana sayfasına çıkan Ably Labs tarafından geliştirilen bir Pong demosu. Dört şerit aynı oyunu aynı servisle çalıştırıyor ve her şeritte farklı bir modele aynı soru yöneltiliyor; her cevap topu bir adım ilerlettiği için bir modelin gecikmesi kelimenin tam anlamıyla hızını belirliyor.

Demosunun kayıtlı deneyinde Jev karar başına ortalama 227 milisaniye, saniyede 4,40 karar ile sonuç verdi; p95 değeri 400ms ve ilk 12 saniyede 47 karar verildi. Chat modelleri aynı süre zarfında ancak iki ya da üç karar verebildi: demoya göre Google'ın Gemini 3.8 Flash'ı ortalama 3.167ms, Anthropic'in Claude Haiku 4.5'i ortalama 2.483ms ve OpenAI'nin GPT-5.6 Sol'u ortalama 3.529ms sürdü. Demoyu hazırlayanlar Pong'u, chat modellerinin en kötü performans gösterdiği Atari oyunu olduğu ve oyun döngüsünün yavaş bir yanıt için beklemeye duraklayamayacağı için seçti.

Erken benimseyenler ve rakamları

TechCrunch, geliştiricilerin Jev'i chat modellerinin yerine koyduğuna dair alıntılar veriyor. Vercel'de yazılım mühendisi olan Pranit Sharma, ekibinin agent komutlarını güvenlik açısından inceleyen bir sınıflandırıcı olarak OpenAI'nin ChatGPT Luna 5.6'sını kullandığını söyledi; bunu Jev ile değiştirmek sonuçları beş ila 18 kat hızlandırdı ve doğruluk da arttı. Bryo AI'nin CTO'su Nikhil Mudholkar, iş e-postalarını sınıflandırmak için Jev'i Gemini ile karşılaştırdı ve Gemini'nin biraz daha doğru ama 10 ila 20 kat daha pahalı olduğunu buldu — Jev'in gerçek olasılık skorları ise iş akışlarını otomatikleştirmek için daha kullanışlı bir özellikti.

Açık kaynak model harness'i Pi'yi geliştiren Earendil'in CTO'su Armin Ronacher, modeli yargıyı geliştiriciye devreden bir yaklaşım olarak tanımlıyor: bir karar yüzde 50'ye yakın dönerse yazı tura at gibi görüp yok sayın; yüzde 95'te ise ona göre hareket edin. Ronacher ayrıca model routing'e — belirli bir iş yükünün hangi modele ihtiyaç duyduğunu ucuz şekilde tahmin etmeye — dikkat çekiyor ve Almeida, Jev'in LLM agent izlerini izlemek ve jailbreak girişimlerini yakalamak için kullanılabileceğini öneriyor; bu iş başka bir LLM ile yapıldığında pahalıya mal oluyor.

Doğrulanmamış bir mimari

Jev'in perde arkasında nasıl çalıştığı kamuya açık değil. TechCrunch'ın aktardığına göre Almeida mimari konusunda sıkı dürtyanlı; dış gözlemciler ise açık ağırlıklı bir LLM üzerine inşa edildiğinden şüpheleniyor. Açıkladığı tek şey, modelin yalnızca sentetik veriyle, kendisinin "kalibre edilmiş kararlardan pekiştirmeli öğrenme" dediği bir teknikle eğitildiği ve bu veriyi üreten iç laboratuvarın şimdi şirketin yarısını oluşturduğu. Yeni modlarda daha fazla sürüm planlanıyor ve Ronacher, kategorinin faydası görünür olduğundan rakiplerin ortaya çıkmasını bekliyor. Almeida ise frontier-lab etiketini reddediyor; TypeSafe'in ürününün hype değil zekâ olmasını tercih ettiğini söylüyor.

Neden önemli

Bugün ciddi hemen her AI uygulaması chat modellerinden geçiyor: genel ve yetenekli, ama fiyatlandırması ve hızı sohbete göre belirlenmiş. Jev, otomasyon işlerinin büyük bir sınıfının — sınıflandırma, güvenlik kontrolleri, routing, izleme — saniyeler içinde bir deneme yerine milisaniyeler içinde bir sayı üreten bir model tarafından daha iyi karşılanacağı yönündeki erken ve öne çıkan bir bahis. Bu bahis tutarsa, zekâ sıradan yazılıma yayılacak kadar ucuzlar — ki bu tam da Almeida'nın hedeflediği Jevons tarzı sonuç. Uyarılar da gerçek: mimari doğrulanmamış durumda, karşılaştırmalar satıcıya yakın demolar ve bireysel geliştirici anekdotlarından geliyor ve model daha birkaç günlük. Ancak elde edilen ilgi, dil tabanlı olmayan karar modellerinin artık başkalarının ciddiye alması gereken bir kategori olduğunu gösteriyor.

  • #ai
  • #machine-learning
  • #developer-tools
  • #startups
  • #reinforcement-learning

İlgili yazılar