· kaynak Hacker News – Front Page (hnrss.org)
Apple'ın LensVLM-9B modeli uzun bağlamları görüntülere sıkıştırıyor ve yalnızca ilgili sayfaları açıyor
Apple, uzun belgeleri sıkıştırılmış görüntüler olarak işleyen ve ayrıntı gerektiğinde yalnızca ilgili sayfaları geri yükleyen LensVLM-9B adlı bir vision-language modelini yayımladı.
Uzun bağlam için farklı bir yol
Apple'ın makine öğrenmesi araştırma ekibi, uzun bağlam sorununa alışılmadık bir yaklaşım getiren dokuz milyar parametreli bir vision language model olan LensVLM-9B'yi yayımladı. Model, bir dil modelinin girdi penceresini tüm belgeleri metin olarak alacak şekilde genişletmek yerine, metnin yoğun şekilde sıkıştırılmış bir görüntüsünü okuyor ve yalnızca ilgili olduğu anlaşılan sayfaları sıkıştırılmamış biçimlerine geri getiriyor. Hugging Face'teki model kartında açıklanan ve Hacker News ana sayfasında öne çıkan bu yaklaşım, eşlik eden makalede seçici bağlam genişletme (selective context expansion) olarak adlandırılıyor.
Sıkıştırma döngüsü nasıl çalışıyor
Model kartına göre LensVLM önce belgenin sıkıştırılmış görüntülerini tarıyor — sürüm, çalışma zamanında bir bayrakla seçilen 5x, 10x ve 15x sıkıştırma ayarlarını destekliyor. Model bir sayfanın eldeki soru için önemli olduğunu düşündüğünde, kullanmayı öğrendiği araçları devreye sokuyor ve bu araçlar söz konusu sayfayı tam, sıkıştırılmamış hâline geri açarak yakından okunabilmesini sağlıyor. Sezgi, bir insanın kalın bir raporu nasıl okuduğuna oldukça yakın: her şeyi küçük resim ölçeğinde gözden geçir, sonra önemli sayfaları aç.
Yayımlanan model, Qwen üzerine inşa edilmiş 9 milyar parametreli bir vision language model; Hugging Face'teki lisans notları, ağırlıkların Qwen modeline Apple'ın yaptığı değişiklikleri içerdiğini belirtiyor. Bu çalışma, Roy Xie, Dan Friedman, Donghan Yu, Bowen Pan ve çalışma arkadaşları tarafından kaleme alınan "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text" başlıklı bir makalede (arXiv:2605.07019) belgelenmiş durumda.
Çalıştırmak için neler mevcut
Kod, GitHub'daki Apple'ın apple-aiml-research/ml-lensvlm deposunda yer alıyor ve model kartı bir demo örneğini adım adım anlatıyor: depoyu klonlayın, gereksinimleri kurun ve demo betiğini apple/LensVLM-9B ile çalıştırın. Özel belgeler için kullanıcılar bir metin dosyasını, bir soruyu ve bir sıkıştırma ayarını birlikte iletiyor; kartın kendi örneği 10x kullanıyor. Dikkat çekici bir nokta, model kartının hiçbir benchmark verisi içermemesi — veri hazırlama ve değerlendirme için depodaki README'ye işaret ediyor; dolayısıyla doğruluk iddialarını tartan herkes makaleye ya da depoya bakmak zorunda.
Lisanslama
İki lisans devrede. Model ağırlıkları ve diğer makine öğrenmesi dosyaları Apple Machine Learning Research Model License kapsamında dağıtılırken, eşlik eden kaynak kodu Apple Sample Code License ile dağıtılıyor. İkisi de geleneksel bir serbest açık kaynak lisansı değil; bu yüzden LensVLM'yi bir üründe kullanmak isteyen herkes, üzerine inşa etmeden önce koşulları dikkatle okumalı.
Neden önemli
Uzun bağlam yarışının büyük bölümü daha büyük pencerelere odaklandı: attention'ı genişlet, key-value cache'i küçült, maliyeti kabul et. LensVLM bunun tersini öneriyor — bağlamı varsayılan olarak ucuz, yalnızca gerektiği yerde pahalı kıl. Değerlendirmeler tutarlıysa, tüm bir belge yerine bir avuç genişletilmiş sayfaya tam dikkat ödeyen bir pipeline, büyük corpora üzerinde soru yanıtlama maliyetini anlamlı biçimde düşürebilir.
Bu aynı zamanda metni görüntü olarak ele alma düşünce hattı için ilginç bir veri noktası. Model, pikselleri kelimeler için sıkıştırılmış bir depolama biçimi olarak ele alıyor ve gerektiğinde açıyor; bağlamı etkili biçimde modelin bellekte tutması gereken bir şeyden, gerektiğinde getirdiği bir şeye dönüştürüyor. Açıkta duran bariz soru, bir vision modelinin sıkı sıkıya sıkıştırılmış glifleri ne kadar güvenilir okuyabildiği; bunun yanıtı da model kartında değil, makalenin değerlendirmelerinde. Apple'ın ağırlıkları araştırma odaklı bir lisansla herkese açık biçimde yayımlamış olması da, merak edip çalıştırmak isteyen herkes için deneyi yeniden üretilebilir kılıyor.
- #apple
- #machine-learning
- #vision-language-models
- #long-context
- #open-weights