deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Google DeepMind, EmbeddingGemma 2'yi tamamen yerel çok modlu RAG için açık kaynak yaptı

Google DeepMind'ın EmbeddingGemma 2'si metni, kodu, görüntüleri, videoyu ve sesi Apache 2.0 lisansı altında tek bir 768 boyutlu vektör uzayına yerleştiriyor ve veriyi hiçbir zaman cihazdan çıkarmayan retrieval hatlarını mümkün kılıyor.

Google DeepMind, EmbeddingGemma 2'yi tamamen yerel çok modlu RAG için açık kaynak yaptı

Google DeepMind, metni, kodu, görüntüleri, videoyu ve sesi tek bir 768 boyutlu vektör uzayına yerleştiren açık ağırlıklı çok modlu bir embedding modeli olan EmbeddingGemma 2'yi yayımladı. Bir dev.to gönderisine göre model 6 Ekim 2026'da Apache 2.0 lisansıyla geldi ve asıl çekici yanı mimarisinde: Retrieval-augmented generation (RAG) hatlarında her embedding ve her benzerlik araması, veriyi barındıran cihaz üzerinde gerçekleşiyor ve üçüncü taraf bir embedding API'sine hiçbir çağrı yapılmıyor.

Modüler encoder'lar, tek bir paylaşılan uzay

EmbeddingGemma 2 tek bir bütünleşik ağ değil; uyumlu bir uzayda vektörler üreten modüler encoder'lar topluluğu. dev.to yazısında dört konfigürasyon listeleniyor: Dokümantasyon ve bilgi tabanları için metin ve koda yönelik 270M parametreli bir sürüm; görüntüler, diyagramlar ve video kareleri için 440M parametreli metin artı görüntü varyantı; kayıtlar ve konuşma için 570M parametreli metin artı ses varyantı; ve her şeyi kapsayan 740M parametreli tam çok modlu konfigürasyon.

Tüm modların tek bir temsili paylaşması sayesinde düz bir metin sorgusu, ara adım olarak başlık veya transkript üretmeden doğrudan bir görüntü ya da ses kaydıyla karşılaştırılabiliyor. Gönderinin altını çizdiği bir nokta var: Bu bir embedding modeli, üretken bir LLM değil. İlgili içeriği buluyor ama yanıtlar yazmıyor; dolayısıyla tamamen cihaz üzerinde çalışan bir RAG yığını için yine de yerel olarak çalışan bir üretken model gerekiyor.

Python ile çalışmak

Google, modeli sentence-transformers 6.1.0 veya daha yeni sürümler için belgelendiriyor. dev.to anlatımı, daha hafif bir yalnızca metin kurulumu için görüntü ve ses encoder'ları devre dışı bırakılarak google/embeddinggemma-2'nin yüklenmesini, belgelerin ve sorguların adlandırılmış prompt'larla ("Document" ve "SearchQuery") kodlanmasını ve parçaların benzerliğe göre sıralanmasını gösteriyor. Medya, bir görüntü dosyası veya toplantı kaydı gibi mod anahtarlı bir sözlük geçirilerek işleniyor; bu vektörler daha sonra bir metin sorgusuyla karşılaştırılabiliyor. İlk çalıştırma ağırlıkları indiriyor; ondan sonra kodlama, önbelleğe alınmış kaynaklardan çevrimdışı çalışabiliyor.

Kırpılabilir vektörler ve depolama ödünleşimleri

EmbeddingGemma 2, Matryoshka Representation Learning'i destekliyor; böylece embedding'ler 768 boyuttan 512, 256 veya 128 boyuta kısaltılabiliyor. Gönderi kabaca bir hesap veriyor: Bir milyon float32 vektör, metadata ve indeks yükü hariç, tam boyutta yaklaşık 3.07 GB yer tutarken 256 boyutta kabaca 1.02 GB tutuyor. Sorgular ve indekslenen içerik aynı boyutları kullanmalı ve kırpılmış vektörlerin retrieval kalitesi gerçek veriler üzerinde denenmeli. Google, belirli cihazlarda optimize edilmiş konfigürasyonlar için bellek rakamları yayımladı; ancak gönderi bunların rastgele Python uygulamaları veya tarayıcılar için evrensel garanti olmadığı konusunda uyarıyor.

Yerel olmak otomatik olarak gizli olmak demek değil

Gönderi, gizlilik tarafını abalamamaya özen gösteriyor. Yerel embedding'ler bazı veri aktarımlarını azaltıyor ama eksiksiz bir güvenlik tasarımının yerini almıyor. Dağıtımların hâlâ şu sorulara yanıt vermesi gerekiyor: Model indirmeleri, günlükler, analitik veya senkronizasyon hassas veri iletiyor mu; embedding'ler ve metadata beklerken nasıl korunuyor; retrieval, sonuçları göstermeden önce belge düzeyinde izinleri zorunlu kılıyor mu; retrieved içerik, prompt injection'a karşı güvenilir olmayan girdi olarak mı ele alınıyor; ve üretken adım cihaz üzerinde mi çalışıyor, yoksa seçili parçalar bir API'ye mi gönderiliyor.

Pratik tarafta, uzun kayıtlar dosya başına tek vektör yerine zaman damgalı bölümler halinde indekslenmeli; çünkü bir videonun tamamına ait vektör belirli bir anı güvenilir biçimde bulamıyor. Taranmış PDF'ler ise görüntü tabanlı retrieval'in yanı sıra OCR'a ihtiyaç duyabiliyor. Gönderi ayrıca bir değerlendirme yöntemi öneriyor ve henüz bağımsız benchmark'ların bulunmadığını belirtiyor: Uzak embedding'leri, yerel yalnızca metin retrieval'ini ve yerel çok modlu retrieval'i aynı derlem ve donanım üzerinde karşılaştırın; 30-50 soru ve recall@k, retrieval gecikmesi, en yüksek bellek ve depolama gibi metrikleri hem 768 hem 256 boyutta yineleyerek kullanın.

Neden önemli

EmbeddingGemma 2, çok modlu RAG'ı pek çok ekip için bulut API'lerine bağlayan iki engeli ortadan kaldırıyor: lisanslama ve veri akışı. Dizüstü bilgisayarda çalışması makul görünecek kadar küçük, 270M ile 740M parametre arasındaki encoder'lara sahip bir Apache 2.0 sürümü, iç dokümantasyonu, kod tabanlarını, ekran görüntülerini ve toplantı kayıtlarını bu içeriğin makineden hiç çıkmadan aramasını gerçekçi kılıyor. Paylaşılan vektör uzayı, daha önce başlık modeli, transkript araçları ve ayrı metin encoder'larını birbirine dikerek kurulan mimarileri de basitleştiriyor.

Model yine de pek çok bileşenden yalnızca biri. Ayrıştırma, parçalama, izinler, artımlı indeks güncellemeleri, değerlendirme ve ayrı bir üretici hâlâ geliştiricinin işi. Ama gizlilik hassasiyeti olan ve çevrimdışı çalışabilen arama için bir yapı taşı olarak, merkezi mühendislik sorusunu "bu veri hangi API'ye gönderilmeli"den "yerel cihaz hangi pipeline aşamalarını makul biçimde çalıştırabilir"e kaydırıyor.

  • #embeddings
  • #rag
  • #open-source
  • #multimodal
  • #google-deepmind

İlgili yazılar