· kaynak Hacker News – Front Page (native)
Stanford ve NVIDIA'nın Kontrastif Dil Modelleri, agent taban çizgilerini 9 kat daha düşük gecikmeyle yakalıyor
Stanford ve NVIDIA araştırmacıları, agent eylemlerini embedding benzerliği yoluyla seçen çift kodlayıcılı modeller olan Kontrastif Dil Modelleri'ni tanıttı; modeller Jev taban çizgisini 9 kata kadar daha düşük gecikmeyle yakalıyor.

Stanford Üniversitesi ve NVIDIA Research araştırmacıları, yapay zeka agent'larında hızlı ve genellenebilir karar verme için tasarlanmış yeni bir model sınıfı olan Kontrastif Dil Modelleri'ni (CLM) tanıttı. 23 Eylül 2026'da yayımlanan ve Hacker News ana sayfasında öne çıkan proje sayfasına göre, amiral gemisi model CLM-8B; bilgisayar kullanımı, oyun ve araç çağırma (tool-calling) görevlerinde Jev taban çizgisiyle eşdeğer performans gösterirken 9 kata kadar daha düşük gecikme sağlıyor.
Agent'lar için Bir Sistem Bir modeli
Jacky Kwok liderliğindeki ve Marco Pavone, Christopher Ré ile Azalia Mirhoseini gibi ortak yazarları barındıran araştırma ekibi, CLM'leri "Sistem Bir" modelleri olarak konumlandırıyor. Bu çerçeve, psikolojinin ikili süreç kuramından esinleniyor: Büyük dil modelleri bir agent bir sonraki adımına karar verirken kasıtlı, token üreten "Sistem İki" akıl yürütücüler olarak çalışırken, CLM karar anında metin üretmeden hızlı ve sezgisel kararlar almak üzere tasarlanmış. Proje sayfası, Dino Run, Super Mario ve WikiRacing dahil etkileşimli demolarla yayımlanıyor.
Model eylemleri nasıl seçiyor
Bir CLM, InfoNCE kontrastif hedefiyle biri durumlar biri eylemler için olmak üzere iki ayrı kodlayıcı eğitiyor. Eğitim sırasında bir durumun embedding'i, gerçekten ondan sonra alınan eylemin embedding'ine yaklaştırılıyor ve diğer tüm eylemlerden uzaklaştırılıyor. Dağıtımda model, mevcut durumu ve bir dizi aday eylemi alıyor, her eylemi embedding'i durum embedding'iyle ne kadar örtüştüğüne göre puanlıyor ve en yüksek puanlı seçeneği seçiyor. İki kodlayıcı fiilen bir zero-shot eylem sınıflandırıcı olarak çalışıyor ve metin üretimi söz konusu olmadığından karar adımı hesaplamalı olarak ucuz.
Eğitim tarifi ve sonuçlar
CLM-8B üç aşamada oluşturuldu: 60 milyon Nemotron soru-cevap çiftiyle ön eğitim, 30 milyon sentetik zor negatif örnekle orta eğitim ve 1 milyon agent yörüngesiyle son eğitim. Araştırmacılar, bilgisayar kullanımı, oyun ve araç çağırma görevlerindeki zero-shot değerlendirmede Jev ile eşdeğer performans ve 9 kata kadar daha hızlı çalışma raporluyor. Hızlanmalar, WikiRacing gibi çok sayıda aday eylem bulunan senaryolarda ya da T-Rex oyunu gibi eylemlerin durumlar arasında sıkça yeniden kullanıldığı durumlarda en büyüktü. Ekip, hafif bir fine-tuning ile CLM-8B'nin agent kodlama kıyaslamalarında yeni en iyi sonuçları da belirlediğini, DeepSWE'de yüzde 81,6 ve Terminal Bench 2.1'de yüzde 87,6'ya ulaştığını belirtiyor.
Altyapı ve ölçekleme yasaları
Ekip ayrıca, durumları eylemlerden ayıran ve embedding'lerinin bağımsız olarak önbelleğe alınıp yeniden kullanılmasına izin veren son derece verimli bir eğitim ve sunum kurulumunu anlatıyor. Modelin kendisinin ötesinde araştırmacılar, CLM'ler için ölçekleme yasaları ortaya koyarak test kontrastif kaybının eğitim hesaplama gücü, model boyutu ve veri kümesi boyutuyla güç yasası biçiminde öngörülebilir şekilde düştüğünü gösteriyor. Sayfaya göre projenin kodu GitHub'da mevcut.
Neden önemli
Günümüzdeki çoğu yapay zeka agent'ı, bir sonraki adımda ne yapacağına karar vermek için büyük ve genel amaçlı bir dil modele prompt gönderip yanıt üretmesini bekleyerek karar veriyor; bu da her adımı yavaş ve maliyetli kılıyor. CLM'ler eylem seçimini, üretimden çok retrieval'a daha yakın bir embedding eşleştirme problemi olarak yeniden çerçeveliyor; bu da agent'ları oyunlar, kullanıcı arayüzü otomasyonu ve gerçek zamanlı kontrol gibi gecikmeye duyarlı alanlarda kullanılabilir kılabilir ya da ucuz Sistem Bir modellerinin rutin adımları hallederken daha büyük akıl yürütme modellerinin zor adımlar için ayrılmasını sağlayabilir. Bildirilen güç yasası ölçeklemesi de iyileştirmelerin deneme yanılma yoluyla keşfedilmek yerine planlanabileceğine işaret ediyor.
Sonuçlar projenin kendi sayfasında kendi tarafından bildirilmiş durumda ve sayfa, Jev taban çizgisinin ne olduğunu ya da değerlendirmelerin nasıl yürütüldüğünü açıklamıyor; dolayısıyla rakamlar kesinleşmeden önce bağımsız doğrulama gerekecek. Yine de yeni bir mimarinin, açıklanmış bir eğitim tarifinin ve ölçekleme analizinin birleşimi, bunu agent kararlarını hem hızlı hem genellenebilir kılmaya yönelik somut bir girişim haline getiriyor.
- #ai-agents
- #machine-learning
- #contrastive-learning
- #research
- #nvidia
İlgili yazılar
- Apple'ın LensVLM modeli, ağır şekilde sıkıştırılmış metin görsellerinde vision-language modellerinin doğruluğunu koruyor
- Transluce, başıboş AI agent'larını üç kamu veri sitesine yönelik hack girişimleriyle ilişkilendirdi
- Claude Code'da Bash(git push:*) deny kuralı 14 push yazımından 5'inin uzak depoya ulaşmasına izin veriyor