· kaynak dev.to (home feed)
EmbeddingGemma 2, cihaz üzerinde arama için tasarlanmış 740M parametreli çok modlu bir embedder
Google DeepMind, metni, kodu, görüntüleri, videoyu ve sesi tek bir ortak vektör uzayına eşleyen, modüler encoder'ları cihaz üzerinde arama ve RAG için tasarlanmış 740M parametreli açık kaynak model EmbeddingGemma 2'yi yayınladı.

Google DeepMind, metni, kodu, görüntüleri, videoyu ve sesi tek bir ortak 768 boyutlu vektör uzayına projekte eden 740 milyon parametreli açık kaynak model EmbeddingGemma 2'yi yayınladı. dev.to'daki teknik bir yazıya göre model, Gemma 4 mimarisi üzerine inşa edilmiş, Apache 2.0 lisansıyla sunuluyor ve veri merkezi sınıfı altyapı gerektirmek yerine bilinçli olarak tüketici donanımında çalışacak şekilde boyutlandırılmış.
Beş modalite için tek vektör uzayı
Bu birleştirme modelin temel vaadi. Beş giriş türünün tamamı aynı koordinat uzayına gömüldüğü için, bir geliştirici tek bir indeks üzerinden gerçekten çapraz modlu arama yapabiliyor: düz bir metin sorgusuyla video kütüphanesindeki bir anı bulmak ya da sesli notta tarif edilen bir kod parçasını çağırmak mümkün. Unite.AI ve MarkTechPost'taki haberlere dayanan dev.to makalesine göre bu, çok modlu arama veya retrieval-augmented generation pipeline'ları kurarken her modalite için ayrı embedder'ları birbirine dikmek gerekliliğini ortadan kaldırıyor.
Model ayrıca gizliliği koruyan uygulamalar için de bir olanak sağlıyor olarak konumlandırılıyor; tamamen bir telefonda veya dizüstü bilgisayarda çalışan arama, temeldeki kullanıcı verilerinin uzak bir servise gönderilmesi gerektirmiyor.
Modüler encoder'lar bellek ayak izini küçük tutuyor
Yapımcılar için en önemli tasarım kararı, 740M parametrenin tek bir blok olmaması. Yazı modeli bağımsız bileşenlere ayırıyor: 270M parametreli bir metin encoder'ı, 170M parametreli bir görüntü encoder'ı ve 300M parametreli bir ses encoder'ı; hepsi tek bir checkpoint'tan yüklenebiliyor.
Bu, uygulamanın yalnızca ihtiyacı olanı yüklemesi anlamına geliyor. Düşük bellekli bir cihazdaki metin ve kod RAG pipeline'ı yalnızca 270M'lik metin bileşenini çekebilirken, bir fotoğraf düzenleme aracı birleşik 440M'lik metin artı görüntü yapılandırmasını yükler. Bildirilen rakamlar kazancı gözler önüne seriyor: Pixel 11 Pro'da yalnızca metin varyantı yaklaşık 191MB aktif bellek kaplarken, tam çok modlu kurulum yaklaşık 567MB belleğe ihtiyaç duyuyor. Orta seviye telefonlara uygulama yayınlayan herkes için bu fark, yapılabilir ile yapılamaz arasındaki fark.
Benchmark kazanımları ve boyut ödünleşimleri
Kalite açısından makale, EmbeddingGemma 2'nin selefine göre MTEB Code benchmark'ında kod aramasını 9,92 puan iyileştirdiğini bildiriyor; bu boyut sınıfındaki bir model için anlamlı bir sıçrama.
Model ayrıca Matryoshka Representation Learning'i destekliyor; bu, geliştiricilerin depolama ve işlem maliyetlerini düşürmek için 768 boyutlu vektörleri 512, 256 veya 128 boyuta kesmesini sağlıyor. Ödünleşimler yazıya göre modaliteye özgü: yalnızca metin iş yüklerinde 256 boyuta düşmek çok dilli benchmark'larda az şey kaybettirirken, görüntü görevleri 128 boyutta daha belirgin biçimde düşüyor; bu nedenle en küçük boyut esas olarak metin için öneriliyor.
Neden önemli
Embedding'ler modern arama ve RAG sistemlerinin bağ dokusudur ve şimdiye kadar çok modlu embedding büyük ölçüde ya büyük sunucu tarafı modeller ya da modalite başına embedder'ları birleştirmek anlamına geliyordu; bu da çapraz modlu sorguları zorlaştırıyordu. Bir telefon için yeterince küçük, metin, kod, görüntü, video ve ses genelinde tek bir ortak uzaya sahip, Apache 2.0 lisanslı bir model, tek başına çalışan bir geliştiricinin neler yayınlayabileceğini değiştiriyor: kullanıcının fotoğrafları, ekran görüntüleri, kayıtları ve belgeleri üzerinde yerel olarak çalışan ve verileri cihazda tutan anlamsal arama.
Modüler encoder yüklemesi ve Matryoshka kesme işlemi, modeli pratik kılan detaylar; mühendislere kısıtlı donanımda bellek, depolama ve kalite dengesi üzerinde doğrudan kontrol sağlıyor. Belirtilmesi değer bir uyarı: burada alıntılanan benchmark rakamları ve cihaz ölçümleri, yayının ilk haberlerinden geliyor, bağımsız bir değerlendirmeden değil; dolayısıyla modeli değerlendiren ekipler performansı kendi verileri üzerinde doğrulamalı.
- #embeddings
- #on-device-ai
- #google-deepmind
- #multimodal
- #rag