deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Cloudflare'ın açık ağırlıklı Clef karar modeli, yerel benchmark'ta ücretli hosted API'ye neredeyse yetişiyor

dev.to'da yayınlanan bir geliştirici benchmark'ı, Cloudflare'ın yeni açık ağırlıklı karar modeli Clef'i, yerini almayı hedeflediği hosted Jev API ile karşılaştırıyor ve ücretsiz 9B varyantının en kritik agent kararlarında ücretli hizmetle eşit olduğunu ortaya koyuyor.

Cloudflare'ın açık ağırlıklı Clef karar modeli, yerel benchmark'ta ücretli hosted API'ye neredeyse yetişiyor

Cloudflare, metin üretmek yerine karar vermek üzere tasarlanmış açık ağırlıklı bir model olan Clef'i yayınladı. 1 Ekim'de dev.to'da yayınlanan uygulamalı bir benchmark'a göre, tek bir RTX 3090 üzerinde yerel olarak çalışan daha küçük Clef-Flash 9B varyantı, en yüksek riskleri taşıyan agent kararlarında ücretli bir hosted API ile eşit oldu; ince ayrım gerektiren sınıflandırmalarda ise gerisinde kaldı.

Clef nedir

dev.to yazısına göre Clef iki boyutta geliyor: 27B amiral gemisi ve 9B Flash varyantı. Her ikisi de Qwen omurgaları üzerine inşa edilmiş ve tipli sorular üzerinden kalibre edilmiş olasılıklar üreten ortak bir schema head ile donatılmış. Model düzyazı üretmek yerine, geliştiriciler modele bir state blob'u ve seçim soruları (her seçenek için kriterlerle) ya da ikili sorular veriyor ve tek bir forward pass ile her seçenek için bir olasılık elde ediyor.

Sürüm, şu anda TypeSafe'in Jev API'sine çağrı başına ödeme yapan agent geliştiricilerini hedefliyor; Clef'in bu API'yi tamamen ikame etmesi planlanıyor. Yazar, Clef'in ikame ettiği yaygın alternatifi şöyle anlatıyor: bir chat modelini regex parsing ile birleştirip mesaj yönlendirmeye, GUI eylem seçimine ya da uzun süreli iş denetimine bağlamak ve ardından çağrılar arasındaki prompt drift ile boğuşmak.

Benchmark kurulumu

Yazar, Clef-Flash 9B'yi PyTorch altında bf16 formatında, Jev-1.13.0'a karşı hosted API üzerinden, aynı prompt'lar, tipli sorular ve seçenek kriterleriyle çalıştırdı. İş yükü sentetik değildi: geceleri ücretli GitHub ödüllerini avlayan gerçek bir otonom kodlama agent'ından alınan 42 etiketli karar kullanıldı. Üç aile test edildi. Önceden doğrulanmış eylem tablolarından alınan, doğru yanıtı hiçbir şey yapmamak olan iki kasıtlı güvenlik tuzağı da dahil on bilgisayar kullanımı eylem seçimi. İlerliyor, yanıt bekliyor, döngüde sıkışmış, engellenmiş ve bitmiş kapsayan beş yönlü sınıflandırmayla on iki alt agent denetim çağrısı. Şimdi, bugün, kuyruk veya yok say etiketli yirmi gelen kutusu tarzı triage yönlendirmesi.

Sonuçlar

Genel skor mevcut sağlayıcı lehine: Jev yüzde 71,4, Clef-Flash yüzde 66,7 genel doğrulukla. Ama asıl hikaye görev bazındaki ayrımda ve bu ayrım yerel modeli aklandırıyor.

Bilgisayar kullanımı eylem seçiminde her iki model de 10 üzerinden 10 ile kusursuz aldı; eksik ayrıntıları olan geri alınamaz bir para transferinde doğru şekilde çekimser kaldılar ve yinelenen bir tıklamayı yutmuş olabilecek bir spinner'dan sonra yeniden gözlemlemeyi tercih ettiler. Denetimde ikisi de 12'de 8 yaptı ve aynı iki vakayı kaçırdı; yazar bu vakalardan birinin kendi altın etiketi bile tartışılacak kadar belirsiz olduğunu kabul ediyor. Triage tek gerçek farktı: Jev 12/20, Clef ise 10/20 aldı. Hosted model çoğunlukla bugün-kuyruk sınırındaki çağrılarda kazandı ve yazar, 9B'lik bir modelin çok daha büyük bir hosted modele karşı ince ayrım yarışını kaybetmesinin beklendiğini belirtiyor.

Gecikme yakındı: Jev ağ üzerinden p50 olarak 225 milisaniye ölçerken, Clef-Flash batch'leme olmadan tamamen yerelde 315 milisaniye sundu. İki model 42 tahminden 35'inde, yani yaklaşık yüzde 83'ünde aynı sonucu verdi; ayrıştıkları yerlerde de aynı temel nedenlerle başarısız olma eğilimindeydiler.

Yerel olarak çalıştırma

Motivasyonun bariz nedeni maliyet, ama yazara göre daha güçlü olan gizlilik: denetim çağrıları, aksi halde yerel ağdan çıkacak log kuyrukları, dosya yolları ve mesaj içerikleri taşıyor; yerel bir model internet erişimi olmadan da çalışmaya devam ediyor. Yükseltme yolu donanıma bağlı. Tam 27B modelin, Flash'ın Jev'in gerisinde kaldığı ince ayrım görevlerinde Flash'ı geçtiği bildiriliyor, ancak bf16'da yaklaşık 54GB VRAM gerektiriyor ki bu bir 3090'ın 24GB'ına karşı. Daha iyi yerel kararlar fiilen ikinci bir GPU satın almak anlamına geliyor.

Bir dağıtım uyarısı öne çıkıyor: Hugging Face'teki topluluk GGUF quantization'ları yalnızca dil omurgasını kapsıyor. Ortak karar head'i transformers kod yolunu gerektirdiğinden, karar işlevselliği bugün llama.cpp'de çalışamıyor. Tam bir yerel kurulum, PyTorch ve depodaki özel ortak schema model dosyası demek.

Yazarın vardığı düzenleme şöyle: denetim ve eylem seçimi çağrıları için varsayılan motor olarak 9B model yerelde kalıyor — ücretsiz ve yeterince hızlı —, triage ise hosted API'de kalıyor çünkü oradaki ince ayrım çağrı başına maliyeti haklı çıkarıyor.

Neden önemli

Clef, genel amaçlı chat modellerini her role zorlama alışkanlığından bilinçli bir sapmayı işaret ediyor. Yönlendirme, kapılama, sıralama ve eylem seçimi karar sorunlarıdır; kalibre edilmiş olasılıklarla özel olarak üretilmiş bir model, chat model tabanlı agent'ları kırılganlaştıran çıktı parsing'i ve drift'i ortadan kaldırıyor. Benchmark ayrıca açık ağırlıkların pratikte neyi değiştirdiğini gösteriyor: gecikme kabaca eşitken, hosted-yerel seçimi verinizin nerede yaşadığına ve her çağrının maliyetine indirgeniyor ve hassas iş yüklerinde yerel ikisini de kazanıyor.

Uyarılar geçerli. Bu tek bir kişinin agent'ından gelen 42 vakalık bir değerlendirme, bir makale değil; ayrıca triage etiketleri, makul operatörlerin farklı yönlendirebileceği yargı kararları içeriyor. Yine de yazarın çıkarımı iyi genellenebilir: kendi değerlendirmenizi çalıştırmak size hangi modelin en iyi olduğundan çok, hangi çağrılarınızın gerçekten ücretli bir API'ye ihtiyaç duyduğunu söylüyor.

  • #cloudflare
  • #open-weights
  • #ai-agents
  • #local-llm
  • #benchmarks

İlgili yazılar