· kaynak dev.to (home feed)
Google'ın Gemma 4'ü beş boyutta geliyor: 1.1 GB'lık telefon modelinden 31B workstation LLM'sine
Google'ın Gemma 4 açık modelleri 1.1 GB'lık telefon derlemesinden 31B yoğun modele kadar beş boyutu kapsıyor; Apache 2.0 lisansıyla, MoE varyantı 4B'ye yakın hızda 26B sınıfı çıktı sunuyor.

Beş boyutlu bir aile
Aile, olağandışı derecede geniş bir donanım aralığını kapsıyor. En küçük olan E2B, 4-bit quantisation'da yaklaşık 2.9 GB belleğe ihtiyaç duyuyor; mobil derleme yaklaşık 1.1 GB, yalnızca metin tabanlı LiteRT-LM sürümü ise 0.84 GB'a kadar iniyor — orta seviye telefonlar için yeterince küçük. E4B, dizüstü bilgisayarlar ve cihaz üzerinde akıl yürütme için 4.5 GB (mobilde 2.5 GB) düzeyinde. 12B Unified çok modlu workstation kullanımı için 6.7 GB, 26B A4B 14.4 GB ve en üst segment olan 31B yoğun model 17.5 GB gerektiriyor. Beşi de metin ve görsel kabul ederken, ses ve video E2B, E4B ve 12B'de yerleşik olarak bulunuyor. Context window'lar iki kademeli: küçük modeller için 128K token, geri kalanlar için 256K token ve 140'tan fazla dil desteği sunuluyor. dev.to yazısı, bu bellek rakamlarının yalnızca model ağırlıklarını kapsadığı, dolayısıyla KV cache'in context büyüdükçe ek yük getireceği konusunda uyarıyor.
Mixture-of-Experts tatlı noktası
Kendi sunucularında barındıranların (self-hoster) en çok ilgisini çeken varyant, toplamda yaklaşık 26 milyar parametreye sahip ancak token başına yalnızca yaklaşık 4 milyarını etkinleştiren bir Mixture-of-Experts model olan 26B A4B. Google, bunun düz bir 4B model kadar hızlı çalıştığını açıkça belirtiyor; yazı bunu temel çekicilik olarak çerçeveliyor: küçük model hızında ve belleğinde 26B sınıfı yetenek. RTX 3090 veya 4090 gibi tüketici GPU'larını ve yeterli RAM'e sahip Mac'leri hedefliyor.
12B Unified encoder'lardan vazgeçiyor
12B Unified, kardeşlerinden sonra geldi çünkü mimarisi ailenin geri kalanından farklı. Görselleri ve sesi dil modelinden önce ayrı encoder'lardan geçirmek yerine, ham görüntü piksellerini ve ses dalga formlarını hafif bir lineer katman aracılığıyla doğrudan embedding uzayına projekte ediyor. Sonuç: tek bir modelin 4-bit quantisation ile yaklaşık 6.7 GB'da metin, görsel ve sesi işlemesi — birçok geliştiricinin zaten sahip olduğu donanımda rahatça çalışan bir model.
Uyarılarla birlikte benchmark sıçramaları
Google'ın kendi yayınladığı ve dev.to'da aktlanan rakamlara göre 31B model, MMLU Pro'da önceki Gemma 3 27B'nin 67.6'ına karşı 85.2 puan alıyor, AIME 2026 matematik testinde 20.8'den 89.2'ye, LiveCodeBench v6'da 29.1'den 80.0'a sıçrıyor. Google her boyut için puanlar yayınlıyor ve bu da ödünleşimleri görünür kılıyor: E2B AIME'de 37.5 alırken 26B A4B 88.3'e ulaşıyor; 31B'nin 89.2'sine neredeyse eşit, ancak runtime'da bunun yarısının da altında bellek kullanıyor. Lansmanda 26B A4B Arena leaderboard'unda açık modeller arasında altıncı, 31B ise üçüncü sıradaydı. Yazı standart uyarıları da ekliyor: bunlar Google'ın kendi seçtiği test kümelerindeki ölçümleri, thinking modu kalite karşılığında daha uzun üretim ve daha fazla output token demek ve leaderboard sıralamaları haftalık değişiyor.
Ekosistem ve Android ivmesi
Gemma bu sürümden önce 400 milyon indirmeyi geçmişti ve Google'ın paylaştığı rakamlara göre 20 Ağustos 2026'da bir milyara ulaştı; 100.000'den fazla topluluk varyantı bulunuyor. Android'de Gemma 4, Nisan başında AICore Developer Preview'a girdi; ağır akıl yürütme için E4B'yi, hızlı görevler için daha hızlı E2B'yi eşleştiriyor; Google, önceki nesle kıyasla dört kat hızlanma ve yaklaşık yüzde 60 daha düşük pil tüketimi bildiriyor. Aile, yıl sonu cihazlarındaki Gemini Nano 4'ün de temelini oluşturuyor ve 1 Eylül'den itibaren gelen Android Studio Quail sürümü, Gemma 4'ü IDE içinde yerel bir araç olarak gömüyor. Nisan ortasında yayımlanan bir Multi-Token Prediction araç setinin, kalite kaybı olmadan çıkarım hızını üçe katladığı bildiriliyor.
Neden önemli
Gemma 4, açık modellerin rekabet biçiminde bir değişime işaret ediyor: yalnızca ham boyut veya öne çıkan benchmark sonuçlarıyla değil, parametre ve gigabayt başına zekâyla. Kendi sunucusunda barındıranlar için pratik harita artık net — 16 GB makineler için E4B'den 12B Unified'a, 24 GB ve üzeri kurulumlar için tatlı nokta olarak 14.4 GB'daki 26B A4B'e ve en yüksek kalite önemli olduğunda daha yavaş olan 31B yoğun modele. Kullanıcı veya gelir sınırı olmayan Apache 2.0 lisansı, rakip bazı açık aileleri kısıtlayan sürtünmeyi ortadan kaldırıyor; bu, modelleri sevk edilen ürünlere gömen startup'lar için önemli. Ve gerçekten telefon capable bir model artı Gemini Nano 4 üzerinden bir cihaz içi yol haritasıyla Google, bir sonraki açık model savaş alanının bulut değil yerel donanım olacağına bahis yapıyor — Alibaba'nın Qwen ekibi gibi rakiplerin artık buna yanıt vermesi gerekecek.
- #open-source
- #google-gemma
- #local-llm
- #machine-learning
- #android
İlgili yazılar
- virtio-nvgpu, driver ioctl'larını ileterek KVM guest'lere近乎 native NVIDIA GPU erişimi sağlıyor
- Apple'ın LensVLM-9B modeli uzun bağlamları görüntülere sıkıştırıyor ve yalnızca ilgili sayfaları açıyor
- PostgreSQL 19, veri sağlama toplamlarını (checksum) çevrimiçi etkinleştirerek sessiz depolama bozulmalarını yakalıyor