deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Apple'ın LensVLM modeli, ağır şekilde sıkıştırılmış metin görsellerinde vision-language modellerinin doğruluğunu koruyor

Apple'ın LensVLM-9B modeli belgeleri sıkıştırılmış görsel olarak okuyor ve yalnızca görevle ilgili bölgeleri büyütüyor; bir makaleye göre 4,3x sıkıştırma düzeyinde tam metin doğruluğuna ulaşıyor.

Apple'ın LensVLM modeli, ağır şekilde sıkıştırılmış metin görsellerinde vision-language modellerinin doğruluğunu koruyor

Apple ne yayımladı

Apple, LensVLM adlı bir vision-language model çerçevesi üzerine araştırma yayımladı ve bu model için apple/LensVLM-9B adlı 9 milyar parametrelik bir checkpoint'i Hugging Face üzerinde yayınladı. "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text" başlıklı makale, Hugging Face'in makaleler bölümünde ortaya çıktı ve 23 Eylül'de Hacker News'in ana sayfasına ulaştı. Konusu pratik bir verimsizlik: Bir vision-language model bir görselden metin okurken, token tasarrufu için görseli küçültmek doğruluğu hızla yok ediyor.

Sıkıştırılmış metin görsellerinin sorunu

Vision-language modeller bir belgeyi uzun bir token dizisine dönüştürmek yerine resim olarak ele alabiliyor. Bu cazip çünkü görsel kodlayıcılar sabit boyutlu bir görseli sabit sayıda görsel token'a eşliyor; bu da çözünürlüğü doğrudan bir kaldıraç haline getiriyor: çözünürlüğü düşürünce metin daha az token tüketiyor. Ama bu kaldıraç bir noktada tıkanıyor. Belirli bir eşiğin ötesinde tek tek karakterler kodlayıcının birbirinden ayırt edebileceğinden küçük hale geliyor ve doğruluk hızla düşüyor.

Yalnızca önemli yeri yakınlaştır

Makalede hem bir inference çerçevesi hem de bir post-training tarifi olarak tanımlanan LensVLM, tam çözünürlük ile kayıplı sıkıştırma arasında orta bir yol izliyor. Model önce sıkıştırılmış görseli tarıyor, görev için önemli olan bölgeleri tespit ediyor ve ardından yalnızca bu bölgeleri sıkıştırılmamış hallerine genişletmek için öğrenilmiş araçları kullanıyor; bu da etkili bir şekilde cevabın muhtemel konumuna yakınlaştırma yapıyor. Yayınlanan model Qwen3.5-9B-Base üzerine inşa edilmiş.

Bildirilen sonuçlar

Makaleye göre LensVLM, 4,3x etkin sıkıştırmada tam metin üst sınırıyla karşılaştırılabilir doğruluğu koruyor ve yedi metin soru-cevap benchmark'ında 10,1x etkin sıkıştırmaya kadar hem retrieval tabanlı yöntemleri hem de metin ve görsel sıkıştırma baselines'larını geride bırakıyor. Yazarlar ayrıca yaklaşımın multimodal belge ve kod anlama görevlerine aktarıldığını ve sıkıştırma arttıkça baselines'a karşı üstünlüğünün genişlediğini, bunun da alışılmış bozulma eğrisinin tersi olduğunu bildiriyor.

Analiz ne gösterdi

Makalenin analizi, uygulayıcılar için faydalı olabilecek iki noktaya değiniyor. Birincisi, eğitim görsel sıkıştırmayı render seçimlerine karşı dayanıklı hale getirmiş; yani yaklaşım, belgenin baştan nasıl render edildiğine aşırı duyarlı değil. İkincisi, sıkıştırma büyüdükçe model, artık çözümleyemediği karakterleri okumaya çalışmak yerine giderek artan biçimde genişletilmiş bölgelere güveniyor.

Yazarlar ayrıca açık bir araç seçimi rehberi de veriyor. Bir bölgeyi metne genişletmek render edilmiş metin için en iyisi; yüksek çözünürlüklü görseli genişletmek ise düzeni görevle ilgili bilgi taşıyan doğal belgeler için uygun.

Neden önemli

Bağlam uzunluğu, ister metin token ister görsel token cinsinden ölçülsün, büyük modelleri çalıştırmanın başlıca maliyetlerinden biri. Belgeleri ayarlanabilir çözünürlükte görsel olarak render etmek, token bütçesi ile sadakat arasında ayarlanabilir bir denge yaratıyor ve LensVLM, sadakat kaybının seçici olarak geri kazanılabileceğini gösteriyor: tam çözünürlük yalnızca cevabın muhtemelen bulunduğu yerde ödeniyor. Uzun belgeler, kod tabanları veya taramalar içeren sistemler için bu, daha az görsel token, daha ucuz inference ve düz sıkıştırmanın neden olduğu doğruluk uçurumu olmadan daha hızlı yanıtlara işaret ediyor.

Hugging Face'te image-text-to-text modeli olarak listelenen herkese açık checkpoint, diğer ekiplerin de iddiayı doğrudan test etmesini sağlıyor. Daha geniş çerçevede bu çalışma, öğrenilmiş araç kullanımının bir verimlilik sorununa uygulandığının somut bir örneği: model, kendi görsel okumasının ne zaman güvenilmez olduğunu tanımak ve bunun yerine daha iyi bir görünüme uzanmak üzere eğitilmiş.

  • #machine-learning
  • #vision-language-models
  • #apple
  • #compression
  • #research

İlgili yazılar