· kaynak dev.to (home feed)
Grouped Value Attention, transformer KV cache'ini yaklaşık %45 azaltıyor ve doğrulukta GQA ile eşit
Yeni bir attention yöntemi, gruplanmış değerleri saklayıp key'leri gerektiğinde yeniden oluşturarak transformer'lardaki KV cache belleğini yaklaşık %45 azaltıyor ve GQA doğruluğunun yalnızca 0,01 puan gerisinde kalıyor.

Ne duyuruldu
Araştırmacılar, transformer'ların KV cache'e harcadığı belleği kabaca %45 azaltırken benchmark doğruluğunu fiilen bozulmadan bırakan bir attention varyantı olan Grouped Value Attention'ı (GVA) önerdi. Sonuç, 25 Eylül 2026'da yayımlanan ve iki makaleyi özetleyen bir dev.to yazısı aracılığıyla geldi: biri GVA'yı "Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction" başlığıyla tanıtan bir makale, diğeri ise DeepSeek-V4.1-Flash'ın cache sıkıştırma yaklaşımını ele alan bir makale.
Çözülen sorun
Otoregresif çözümleme sırasında bir transformer, işlediği her token için bir key ve bir value vektörü tutar. Bu nedenle cache, dizi uzunluğuyla birlikte büyür ve uzun bağlam (long-context) çıkarımında baskın bellek maliyeti haline gelme eğilimindedir. Yaygın olarak benimsenen çözüm olan grouped-query attention (GQA), value head sayısını azaltır ama her token için yine de bir key saklar; dolayısıyla temeldeki bellek baskısı sürer.
GVA nasıl çalışıyor
GVA, cache'in key tarafını neredeyse tamamen bırakıyor. Yalnızca gruplanmış değerleri saklıyor ve her key'i çözümleme sırasında gerektiğinde yeniden oluşturuyor; böylece üretim sırasında eksiksiz bir key matrisinin var olması gerekmiyor. Kalıcı durumun bu bölümünün kaldırılması, cache boyutunun neredeyse yarıya inmesini sağlıyor.
Rakamlar
350 milyon parametrelik bir modelde yazı, GVA'nın eşleşen bir GQA baseline'ına kıyasla kalıcı cache skalerlerini yaklaşık %46 azalttığını ve ortalama görev doğruluğunu 0,01 puan içinde tuttuğunu bildiriyor. Makalenin yazarları azalmayı kabaca %45–47 olarak tanımlıyor ve GVA'nın 16 boyutlu konumsal varyantı beş görevde ortalama 44,35 doğruluk elde ediyor; bu değer GQA için 44,36, DeepSeek tarzı modellerle ilişkilendirilen latent-attention şeması MLA için ise 43,88.
DeepSeek'ten ikinci bir veri noktası
Aynı dev.to özeti, cache sıkıştırmayı daha da ileri taşıyan DeepSeek-V4.1-Flash'ı ele alıyor. Bildirildiğine göre model, global HBM ayak izini token başına 890 bayta, yani öncülünün yaklaşık dörtte birine indiriyor ve makalenin SWA Bounded Replay adını verdiği bir dağıtım optimizasyonu, kalıcı KV cache'i kabaca DeepSeek-V4-Flash'ın sekizde birine düşürüyor. Bu keskilere rağmen yeni modelin o baseline'ı geride bıraktığı iddia ediliyor. Tasarım ayrıca FP4 cache'lemeye ve katmanlar arası yeniden kullanıma dayanıyor.
Henüz kanıtlanmamış olanlar
Özetlendiği haliyle iki makale de standart GPU'larda uçtan uca gecikme kazanımları göstermiyor. GVA'nın özel çözümleme kernel'ları hâlâ değerlendiriliyor, dolayısıyla gerçek dünyadaki verimlilik iyileşmeleri açık sorular olarak duruyor. DeepSeek'in FP4 yaklaşımı en çok hızlı düşük hassasiyetli aritmetik destekli donanımdan yararlanırdı; bu da dağıtım ortamına bağımlılık ekliyor.
Neden önemli
KV cache için bellek, LLM servislerinin en büyük kalemlerinden biri: batch boyutunu sınırlıyor, bağlam uzunluğunu kısıtlıyor ve donanım maliyetini büyütüyor. GVA'nın yaklaşık %45'lik azaltması kalite değişmeden üretim ortamında geçerli olursa, operatörler aynı iş yüklerini çok daha az bellekle sunabilir ya da mütevazı GPU'lara çok daha uzun bağlamları taşıyabilir. Yazı ayrıca, bu tür yöntemlerin tüketici sınıfı donanımda uygulanabilir bağlam uzunluğu tanımını sıfırlayabileceği gerekçesiyle uzun bağlam benchmark'larının daha sıkı cache bütçeleri altında yeniden çalıştırılmasını öneriyor. Uyarıyı gözden kaçırmamak gerekir: tasarruf edilen bellek otomatik olarak tasarruf edilen gecikme demek değildir ve GVA'nın kernel'ları yayımlanıp gerçek servis yığınlarında benchmark'a tabi tutulana kadar pratik kazanç, kesinleşmiş bir sonuçtan çok umut verici bir hipotez olarak kalıyor.
- #kv-cache
- #transformers
- #llm-inference
- #deepseek
- #model-efficiency