deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Google'ın EmbeddingGemma 2'si metin, görsel, ses ve video embedding'lerini cihaz üzerinde birleştiriyor

Google, metni, kodu, görselleri, sesi ve videoyu tek bir embedding uzayına eşleyen ve telefonlarda ve dizüstü bilgisayarlarda çalışacak boyutta, 740 milyon parametreli açık kaynak modeli EmbeddingGemma 2'yi yayımladı.

Google'ın EmbeddingGemma 2'si metin, görsel, ses ve video embedding'lerini cihaz üzerinde birleştiriyor

Google, metni, kodu, görselleri, sesi ve videoyu tek bir paylaşımlı embedding uzayına eşleyen ve tamamen tüketici donanımında çalışacak şekilde tasarlanmış hafif çok modlu (multimodal) bir embedding modeli olan EmbeddingGemma 2'yi yayımladı. Şirketin duyurusuna göre model, Gemma 4 mimarisi üzerine inşa edilmiş, ticari açıdan serbest Apache 2.0 lisansıyla sunuluyor ve tam çok modlu yapılandırmasında toplam 740 milyon parametreye sahip.

Orijinal EmbeddingGemma, geçen yıl cihaz üzerinde arama ve erişim (retrieval) odaklı, yalnızca metinle çalışan bir embedder olarak ortaya çıktı. Google, modelin o zamandan beri 20 milyon indirmeyi aştığını, geliştiricilerin onu yerel arama araçları ve gizlilik odaklı retrieval-augmented generation (RAG) hatlarında kullandığını söylüyor. İkinci sürüm bu kapsamı metnin ötesine taşıyarak kodu, görselleri, videoyu ve sesi de aynı uzaya dahil ediyor.

Kıyaslamalar ve mimari

Google, EmbeddingGemma 2'nin Gemini Embedding modelleriyle aynı teknolojiden inşa edildiğini söylüyor ve MTEB (Massive Text Embedding Benchmark) Code ve MAEB (Massive Audio Embedding Benchmark) gibi kıyaslamalara atıfta bulunarak, bir milyar parametrenin altındaki çok modlu embedder'lar arasında kendi boyut sınıfında en iyi sonuçları aldığını iddia ediyor. Özellikle kod konusunda şirket, MTEB Code'da selefine göre 68.76'dan 78.68'e yükselerek 9.92 puanlık bir kazanım bildiriyor ve modelin yerel kod tabanı indeksleme, semantik kod arama ve kodlama ajanı erişimi için uygun olduğunu öne sürüyor.

Model yapısı gereği modüler: yalnızca metin iş yükleri yaklaşık 270 milyon parametre gerektirirken, tam çok modlu kapsam için isteğe bağlı görü (170 milyon) ve ses (300 milyon) kodlayıcıları eklenebiliyor. Model ayrıca Matryoshka Representation Learning uyguluyor; bu, geliştiricilerin varsayılan 768 boyutlu çıktı vektörlerini 512, 256 veya 128 boyuta küçültmesini sağlıyor. Google, bunun yerel vektör veritabanları için depolama ve bellek kullanımını 6 kata kadar azaltabileceğini söylüyor.

Telefonlar ve dizüstü bilgisayarlar için boyutlandırıldı

EmbeddingGemma 2, EmbeddingGemma 1'in dört katı büyüklüğünde 8K token'lık bir bağlam penceresini destekliyor. Google, bu kapasitenin yerel donanımda işlenmek üzere 5.5 dakikaya kadar sesi, 29 görsele, 58 video karesini veya bunların birbirine karışmış kombinasyonlarını kapsadığını belirtiyor.

Bellek rakamları doğrudan telefonlara yönelik: bir Google Pixel 11 Pro üzerinde nicemleme (quantization) ile model, yalnızca metin ağırlıkları için yaklaşık 191MB, tam çok modlu model için ise yaklaşık 567MB aktif RAM'e ihtiyaç duyuyor.

Ekosistem ve kullanılabilirlik

Google, yerel embedding'lerin temel faydasını gizlilik ve gecikme süresi olarak çerçeveliyor; çünkü veriler cihazdan asla çıkmıyor ve çapraz modlu arama çevrimdışı çalışabiliyor. Şirket, EmbeddingGemma 2'nin Gemma 4 gibi bir üretken modelle eşleştirildiğinde tamamen cihaz üzerinde çalışan RAG hatlarını desteklediğini ve iki model ortak bir metin tokenizer'ı ile ses kodlayıcısını paylaştığı için birlikte çalıştırılmalarının toplam bellek ayak izini azalttığını söylüyor.

Model ağırlıkları Hugging Face ve Kaggle'da mevcut; Gemini Enterprise Agent Platform Model Garden ise "yakında" olarak listeleniyor. Google ayrıca cihaz üzerinde optimize edilmiş varyantlar için Hugging Face'teki LiteRT Community'ye işaret ediyor. Dağıtım seçenekleri arasında çapraz platform uygulamalar için MediaPipe ve LiteRT, tarayıcı için ise WebGPU destekli transformers.js yer alıyor. Model, transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama ve LMStudio üzerinden sunulabiliyor; vektör depolama için Qdrant anılırken, fine-tuning rehberliğini Unsloth sağlıyor.

Neden önemli

Embedding'ler modern arama ve RAG sistemlerinin bağ dokusudur; metni, görselleri, sesi ve videoyu tek bir uzaya gömen tek bir model, ayrı mod bazlı hatlar bakımı gerektirmeden düz bir metin sorgusunun bir video klibini veya sesli notu ortaya çıkarmasını sağlar. Bunu 740 milyon parametreyle ve birkaç yüz megabayt RAM ile yapmak, erişim işini sunucu çiftliklerinden cihazın kendisine taşıyor; bu da gizlilik açısından hassas uygulamalar ve çevrimdışı kullanım için önemli. Apache 2.0 lisansı benimsemede ticari engelleri kaldırıyor ve Google'ın kendi boyutunun iki katından büyük bazı modelleri geçtiği iddiası, cihaz üzerinde yapay zekanın varsayılan beklenti haline geldikçe küçülen ve verimli hale gelen embedder'ların daha geniş eğilimine işaret ediyor. Bir uyarı: performans rakamları Google'ın kendi duyurusundan geliyor; bu nedenle bağımsız kıyaslama testleri, iddiaların satıcı testleri dışında geçerli olup olmadığını gösterecek.

  • #embeddings
  • #on-device-ai
  • #multimodal
  • #gemma
  • #google

İlgili yazılar