deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Makale, LLM'ler Arasında Doğrudan KV-Cache İletişimi Öneriyor: Hız ve Doğruluk

arXiv'te yayımlanan bir makale, LLM'lerin ara metin yazmak yerine iç temsillerini doğrudan paylaşmasını sağlayan Cache-to-Cache (C2C) yöntemini tanıtıyor; doğruluk artışı ve ortalama 2,5 kat gecikme iyileşmesi raporlanıyor.

Makale, LLM'ler Arasında Doğrudan KV-Cache İletişimi Öneriyor: Hız ve Doğruluk

Metni atlayan bir kısayol

Birden fazla büyük dil modelini bir araya getiren pipeline'lar neredeyse her zaman modeller arasındaki arayüz olarak metni kullanıyor: bir model yanıtı yazıyor, diğeri onu okuyor. Yakın zamanda Hacker News'in ana sayfasına çıkan bir arXiv makalesine göre bu gelenek gizli maliyetler taşıyor. Bir modelin içsel anlamını bir token dizisine düzlemek anlamsal ayrıntıları ortadan kaldırıyor ve bu token'ları tek tek üretmek gecikme ekliyor. Ekim 2025'te ilk sürümü yayımlanan ve Mart 2026'da revize edilen, Tianyu Fu tarafından sunulan makale, modellerin iç durumlarını doğrudan devretmesini öneriyor.

KV-cache'in bununla ilgisi ne?

Çıkarım sırasında bir transformer bir KV-cache tutar: her token için hesaplanan ve saklanan key ve value tensor'ları, modelin o işi yeniden yapmadan önceki bağlama dönmesini sağlar. Yazarlar, bu cache'in bir iletişim kanalı olarak da işe yarayıp yaramayacağını kontrol etmek için önce oracle deneyleri yürüttü. Sonuçları: bir KV-cache'e daha zengin semantik yüklemek, cache'i büyütmeden yanıt kalitesini artırdı. Yazarlara göre bu, cache'in yalnızca bir hız optimizasyonu değil, modellerin anlam alışverişi yapabileceği yaşanabilir bir ortam olduğunun kanıtı.

Cache-to-Cache nasıl çalışıyor

Önerilen yöntem olan Cache-to-Cache (C2C) üç ana bileşenden oluşuyor:

Küçük bir sinir ağı, kaynak modelin KV-cache'ini hedef modelin temsil uzayına eşliyor ve hedef modelin kendi cache'iyle birleştiriyor. Her katman enjeksiyondan aynı ölçüde yararlanmadığı için, öğrenilebilir bir gating mekanizması aktarılan cache'i hangi hedef katmanların gerçekten alacağını seçiyor. Ve hiçbir şey kelimeye serileştirilmediği için, hedef model yazılı bir ara adım olmadan iki modelin de geliştirdiği bilgiden yararlanabiliyor.

Raporlanan rakamlar

Makaleye göre, tek başına çalışan modellerle karşılaştırıldığında C2C ortalama yüzde 6,4 ile 14,2 arasında daha yüksek doğruluk sağlıyor. Modellerin yanıtları metin olarak alışveriştigi pipeline'lara karşı ise yaklaşık yüzde 3,1 ile 5,4 kazanım sağlıyor. Hiçbir model ara düzyazı üretmek için zaman harcamadığından ortalama 2,5 kat gecikme iyileşmesi de sunuyor. Yazarlar kodlarının herkese açık şekilde yayımlandığını belirtiyor; bu da bağımsız doğrulamayı kolaylaştırmalı — nitekim tüm bu rakamlar dış benchmark'lardan değil, makalenin kendi değerlendirmesinden geliyor, bunu not etmek gerek.

Neden önemli

Çok modelli kurulumlar üretimde zaten yaygın: sorguları uzman modellere yönlendirmek, doğrulama adımları eklemek ve birkaç sistemi birleştirmek standart uygulamalar. Bu koordinasyonun neredeyse tamamı şu anda metin üzerinden yürüyor ve bu durum hem modeller arasında taşınan bilgi miktarını hem de zincirin tamamının yürütülme hızını sınırlıyor. Doğrudan cache düzeyinde aktarım daha geniş değerlendirme altında ayakta kalırsa, her iki boyutu aynı anda iyileştirmenin bir yolunu sunuyor — daha zengin bilgi alışverişi ve daha kısa tur süreleri.

Fikir ayrıca LLM'ler arası iletişimin amacını yeniden çerçeveliyor. İç temsiller sistemler arası birinci sınıf bir değişim formatı haline gelebilir; insan tarafından okunabilir metin ise pipeline'ın iki ucundaki insanlara ayrılabilir.

Açık sorular duruyor: projeksiyon ve gating ağlarının her model çifti için ne kadar eğitime ihtiyaç duyduğu, kazanımların görevler ve model ölçekleri genelinde sürüp sürmediği ve yöntemin kaynak ile hedef arasındaki mimari uyuşmazlığın ne kadarını absorbe edebildiği. Yayımlanan kod, araştırmacılara bu sınırları test etmek için somut bir başlangıç noktası veriyor.

  • #llm
  • #kv-cache
  • #machine-learning
  • #research
  • #inference

İlgili yazılar