deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Vercel blog

Vercel Sandbox artık Terminal-Bench ve diğer Harbor değerlendirmelerini Firecracker microVM'lerde çalıştırıyor

Terminal-Bench, SWE-bench ve OSWorld dahil Harbor değerlendirmeleri artık Vercel Sandbox üzerinde çalıştırılabiliyor; her deneme kendi Firecracker microVM'sinde izole ediliyor ve gizli bilgiler VM dışında tutuluyor.

Vercel Sandbox artık Terminal-Bench ve diğer Harbor değerlendirmelerini Firecracker microVM'lerde çalıştırıyor

Vercel, blogunda yaptığı duyuruyla Vercel Sandbox'ın artık Harbor değerlendirmelerini barındırabildiğini bildirdi; bu, ekiplere Terminal-Bench gibi coding-agent benchmark'larını yerel donanım yerine izole bulut microVM'lerinde çalıştırma imkânı veriyor.

Harbor, Terminal-Bench'in arkasındaki açık kaynak değerlendirme araç seti ve Vercel'e göre kayıt defteri SWE-bench, tau3-bench ve OSWorld gibi benchmark'ları da kapsıyor. Entegrasyon tek bir bayrağa indirgeniyor: harbor run komutuna --env vercel ekleyin ve her deneme kendi Firecracker microVM'sinde çalışsın. Denemeler artık bir makineyi paylaşmadığı için, Vercel'e göre değerlendirmeler yerel bir bilgisayarın sınırlarını çok aşacak şekilde paralelleştirilebiliyor.

Entegrasyon ne yapıyor

Her deneme kendi Firecracker microVM'sini alıyor; bu da agent benchmark'larının tipik olarak istediği şeye uyuyor: her görev temiz, izole bir ortamdan başlıyor ve başarısız olan bir deneme başka bir denemeyi bozamıyor. Eşzamanlılık --n-concurrent bayrağıyla ayarlanıyor ve Vercel'in örnek senaryosu, fx agent'ını kullanarak terminal-bench-2-1 veri seti üzerinde aynı anda sekiz deneme çalıştırıyor.

Ağ ve kimlik bilgileri VM dışında kalıyor

Vercel'in izolasyonu ele alma biçiminde iki tasarım kararı öne çıkıyor. Birincisi, bir görevin ağ politikası VM içinde çalışan herhangi bir bileşen yerine, sandbox güvenlik duvarında, VM'nin dışında uygulanıyor. İkincisi, isteğe bağlı bir kimlik bilgisi enjeksiyonu özelliği, gizli bilgileri aynı güvenlik duvarında eşleşen giden isteklere ekliyor; böylece kimlik bilgileri hiçbir zaman sandbox'ın kendisine ulaşmıyor.

İkinci nokta özellikle bu kullanım senaryosu için önemli. Değerlendirilen bir agent, ortamı içinde rastgele komutlar çalıştırıyor ve VM'de saklanan bir API anahtarı, o agent'ın okuyabileceği veya sızdırabileceği bir şey. Gizli bilgileri güvenlik duvarı katmanında tutmak, model sağlayıcısına yapılan çağrılar gibi kimlik doğrulamalı isteklerin geçişine izin verirken bu riski ortadan kaldırıyor.

Tek anahtar, çok sayıda model

Bu özellik, Vercel'in AI Gateway'iyle birlikte geliyor. Tek bir AI_GATEWAY_API_KEY, birden fazla sağlayıcıdaki yüzlerce modele erişim sağlıyor ve farklı bir modeli benchmark etmek, yalnızca farklı bir --model değeriyle aynı komutu çalıştırmak anlamına geliyor. Vercel örneğinde, tek bir bayrak değişikliğiyle bir Anthropic modeli OpenAI modeliyle değiştiriliyor ve aynı benchmark yeniden çalıştırılıyor.

Başlarken

Entegrasyon, Harbor 0.22.0 veya daha yeni bir sürüm gerektiriyor. Kurulum; uv ile Vercel eklentisiyle Harbor'ı yüklemeyi, bir VERCEL_TOKEN ve bir AI_GATEWAY_API_KEY dışa aktarmayı, ardından terminal-bench veri seti, bir agent, bir model, Vercel ortam bayrağı ve bir eşzamanlılık ayarıyla harbor run komutunu çalıştırmayı içeriyor. Vercel, kurulum, yapılandırma ve sorun gidermeyi kapsayan Sandbox dokümantasyonunun yanı sıra adım adım bir rehber yayımladı.

Neden önemli

Agent'ları değerlendirmek sessizce bir altyapı sorununa dönüştü. Terminal-Bench gibi benchmark'lar gerçek bir ortam önyükleme, bir agent'ın işini tamamlamasına izin verme ve sonucu puanlama gerektiriyor; çoğu zaman birçok deneme ve birden fazla model üzerinden. Bunu yerel olarak çalıştırmak, deneyi tek bir makinenin kaynaklarıyla sınırlıyor ve kimlik bilgilerini, tam da test edilen yazılımın erişim menziline yerleştiriyor.

Bu çalıştırmaları tek kullanımlık microVM'lere taşımak her iki kısıtlamayı da çözüyor: eşzamanlılık dizüstü bilgisayara değil buluta göre ölçekleniyor ve gizli bilgiler sandbox dışında kalıyor. Model sağlayıcılarını soyutlayan tek bir gateway anahtarıyla birleştiğinde, agent'ları ve modelleri tüm bir benchmark paketi üzerinden karşılaştırmak, özel bir kurulum değil rutin bir komut haline geliyor; bu da görünüşe göre tam olarak Vercel'in ortadan kaldırmayı hedeflediği sürtünme.

  • #vercel
  • #ai-agents
  • #benchmarking
  • #firecracker
  • #cloud

İlgili yazılar