deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Vercel blog

Vercel, Python AI SDK'ye deneysel evaluate API'si üzerinden Jev sınıflandırıcı desteği ekledi

Vercel'in Python için AI SDK'sı artık Jev adlı yeni model sınıfına yönelik deneysel bir evaluate() API'si içeriyor; Jev, metin üretmek yerine yapılandırılmış çoktan seçmeli sorulara güven skorlarıyla yanıt veriyor.

Vercel, Python AI SDK'ye deneysel evaluate API'si üzerinden Jev sınıflandırıcı desteği ekledi

Jev nedir

Vercel blogunda yayımlanan bir yazıya göre Jev adlı yeni bir yapay zekâ modeli kategorisi geniş çapta denemelere konu oluyor; insanlar onu ticari kararlardan kullanıcı arayüzü üretimine kadar her alanda kullanıyor. Serbest biçimli metin üreten bir dil modelinin aksine Jev, evrensel bir sınıflandırıcı gibi davranır: ona bazı veriler ve bir dizi çoktan seçmeli soru verirsiniz, o da her soruya ilişkin cevaplarla birlikte bir güven skoru döndürür.

Vercel, klasik sınıflandırıcıların — örneğin bir spam filtresinin — her yeni iş için etiketli veri ve göreve özel eğitim gerektirdiğini açıklıyor. Jev'in arkasındaki ekip ise bunun yerine bir LLM'i, bu tür eğitime ihtiyaç duymayan bir sınıflandırıcıya dönüştürmenin yolunu bulmuş; çünkü model zaten geniş bir genel bilgiye sahip. Sonuç ucuz ve hızlı: düz metin üretmek yerine, sorularınızda tanımladığınız tiplere ve seçeneklere uygun yapılandırılmış JSON döndürüyor. Vercel yine de modelin hâlâ hata yaptığına dikkat çekiyor; yeterince isabetli olup olmadığının her kullanım senaryosunda testlerle ortaya konması gerektiğini belirtiyor.

Python'da evaluate() API'si

Modeli denemeyi kolaylaştırmak için Vercel'in Python ekibi, modele doğrudan bağlanan deneysel bir evaluate() fonksiyonu içeren AI SDK for Python sürümünü yayımladı. Kurulum, paketi uv add ai ile yüklemek, bir AI Gateway anahtarı oluşturmak ve AI_GATEWAY_API_KEY değişkenini ayarlamaktan ibaret; çağrılar typesafe-ai/jev modelini hedefliyor.

Vercel, Python arayüzünün Jev'in resmî API'sini neredeyse bire bir yansıttığını söylüyor. Tek bir fonksiyon var: evaluate(). Bu fonksiyon bir model, bir state (basit bir metin ya da rastgele JSON) ve bir soru eşlemesi alıyor. Sorular üç biçimde geliyor: bir listeden tek bir seçenek seçmek için ChoiceQuestion, girdiyi tanımladığınız bir ölçeğe göre puanlamak için ScoreQuestion ve belirli bir ifadenin ne kadar olası olduğunu tahmin etmek için NoulQuestion.

İki deney, karışık sonuçlar

Yazı daha sonra, yazarın açıkça "dengesiz" olarak nitelediği ve okuyucularya hangisinin hangisi olduğuna karar vermeye davet ettiği iki örnek üzerinden ilerliyor.

İlkinde Jev tam anlamıyla bir sınıflandırıcı olarak kullanılıyor: agentic bir Python REPL'ine yazılan metnin İngilizce mi yoksa Python kodu mu olduğunu belirlemek. Yazar bu iş için daha önce iki gün harcayıp özel bir sınıflandırıcı eğitmeyi denemiş ama arayüz kelime ortasında diller arasında sürekli geçiş yaptığı için vazgeçmişti. Jev belirgin biçimde daha iyi performans gösteriyor, yine de boşluklar var: kısmen yazılmış "what's" + " up" ifadesini İngilizce olarak okuyor; oysa bir insan bunun eksik bir Python ifadesi olduğunu fark ederdi.

İkinci deney, Jev'i hiç yapmak için tasarlanmadığı bir işe sokuyor: kod yazmak. Jev metin üretemediğinden yazar önce ondan karakterleri tek tek seçtirmeyi denemiş, sonra da bir dizi seçim yoluyla soyut bir sözdizimi ağacı oluşturmaya yönelmiş. Bir LLM — bu örnekte GPT-5.6 — önce kullanıcının prompt'unu ayrıntılı talimatlara genişletiyor; çünkü bir plan olmadan Jev en temel görevlerde bile zorlanıyor. Her adımda Jev, o ana kadarki programı, doldurulmakta olan alanı ve her birinin üreteceği kodun önizlemesini içeren aday düğümleri görüyor; noktalama ve girintileyi ise çevresindeki program hallediyor. Çıktı sözdizimsel olarak geçerli ama büyük ölçüde hatalı Python'du; yazarın çıkarımı ise net: sınıflandırıcıların üretken bir modelin işini yapması zor. Kod, daha iyisini yapabileceğini düşünen herkes için GitHub'da yayımlandı.

Neden önemli

Jev, sohbet tarzı modellerden farklı bir pazarlık sunuyor: düz metin yok, sadece hızlı, ucuz, tipli ve güven skoru eklenmiş kararlar. Bu profil, ekiplerin şu anda tam LLM fiyatları ödediği ve ardından çıktıyı ayrıştırmaya uğraştığı bir dizi üretim sorununa — yönlendirme, yeniden sıralama, filtreleme, eşik değerlendirme — uygun. Bunun SDK'da birinci sınıf bir çağrı olarak sunulması, Python geliştiricileri için bu fikri test etmenin eşiğini düşürüyor; yazının Jev'in nerede yetersiz kaldığına dair açık sözlü anlatımı ise başlı başına yararlı bir ölçüt. Vercel'in çerçevesiyle bu model sınıfı henüz keşfedilmeye yeni başlandı ve şimdilik dürüst hüküm şu: model geçimini üretimden çok dar kapsamlı kararlarda kazanıyor.

  • #ai
  • #python
  • #sdk
  • #machine-learning
  • #vercel

İlgili yazılar