· kaynak dev.to (home feed)
Google DeepMind, milyon token çıktılı Gemini 4 Argon'u siber savunmacılara öncelikli erişimle duyurdu
Google DeepMind'ın Gemini 4 Argon'u çoğu lansman benchmarkında ilk sırayı alıyor, çağrı başına bir milyona kadar token üretebiliyor ve fiyat olarak Claude Opus 5.5'in altında — ancak ilk erişim güvenilir siber savunmacılarla sınırlı.

Google DeepMind, 30 Eylül 2026'da Gemini 4 Argon'u duyurdu; bu, geçen kasımdaki Gemini 3.1 Pro'dan bu yana ilk yeni frontier modeli ve yaklaşık yedi aydır Flash serisi dışındaki ilk sürümü. Lansmanla ilgili bir dev.to analizine göre Argon, GPT-6 Astra ve Claude Opus 5.5 ile karşılaştırılan 18 benchmarktan 13'ünde ilk sırayı alıyor; bu tabloyu yazı VentureBeat'e dayandırıyor. Model, çağrı başına çıktı limitini yaklaşık 64.000 tokenden yaklaşık bir milyona çıkarıyor ve giriş API fiyatı Claude Opus 5.5'in yarısı. Ancak henüz neredeyse kimse kullanamıyor: ilk erişim dalgası güvenilir (vetted) siber güvenlik savunmacılarına gidiyor.
Benchmark tablosu ne diyor
dev.to yazısında aktarıldığı şekliyle Google'ın lansman rakamları, Argon'u uzun vadeli yazılım mühendisliğinde (DeepSWE v1.1'de %77,9; Opus 5.5 için %74,2 ve Astra için %74,1), uçtan uca iş iş akışlarında (AutomationBench'te %51,3; rakiplerde %42,5 ve %41,4) ve hukuki araştırma ile metin taslağı hazırlamada (Harvey Legal Agent'ta %19,6; rakiplerde %5,4 ve %3,8) ilk sıraya koyuyor. Ayrıca FrontierSWE V2'de %55, LAB-Bench 2'de %88,8, LVBench uzun video anlama testinde %91,7 ve Vals Finance Agent'ta %65,4 ile önde.
Güvenlik tarafında model, CWE-bench v1'de %68 alarak GPT-6 Astra ile eşit, ve saldırganlar Gray Swan prompt enjeksiyonu setinde yalnızca %0,7 başarı sağladı — bildirilen en iyi rakam. Artificial Analysis, Intelligence Index'ini 53 olarak, GPT-6 Astra ile eşit veriyor; ancak Terminal-Bench 4'te %57 kaydediyor ve bu, %64 ile Sonnet 5.5, %60 ile Opus 5.5 ve %59 ile Astra'nın gerisinde; yani agentic kodlama alanındaki üstünlük evrensel değil.
Milyon tokenlık çıktı tavanı
Bir milyonluk girdi bağlamı artık farklılaştırıcı değil; asıl değişiklik çıktı tarafında. Önceki Gemini modelleri çıktıyı yaklaşık 64K tokende sınırlıyordu. Argon tek bir çağrıda kabaca bir milyon token üretebiliyor — dev.to yazısı bunu yaklaşık 3.000 sayfalık metne, ya da durmadan yeniden yazılan orta boy bir codebase'e benzetiyor. Pratik gerekçe agent'larla ilgili: tüm bir planı ve tam teslim edileceği çıktıyı tek bir üretimde tutabilen model, işi parçalara bölerek, yeniden başlayarak ve bağlamı yeniden kurarak daha az zaman harcar; uzun süreli görevlerin genellikle savrulduğu nokta da tam olarak budur. Google mimari ya da parametre sayısı hakkında neredeyse hiçbir şey açıklamadı. Argon, yazılım mühendisliği, hukuk ve finans bilgi işlerine ile siber güvenliğe yönelik, genişletilmiş düşünme (extended thinking) özellikli bir reasoning modeli olarak tanımlanıyor.
Başlangıçta Opus'un yarısı fiyat
Giriş fiyatı, $4/$20'ye dönmeden önce, milyon girdi tokenı başına $2 ve milyon çıktı tokenı başına $10; önbelleğe alınmış girdi $0.10 (yani %95 indirim). Bu açılış fiyatı Claude Opus 5.5'in $4/$20 liste fiyatının yarısı ve GPT-6 Astra fiyatlandırmasının yaklaşık beşte biri. Kaynak bunu tek seferlik değil bir eğilim olarak çerçeveliyor: Opus 5.5'in kendisi de Opus 5'e kıyasla girdi ve çıktıda %20, önbellekten okumada %60 indirim yapmıştı; yani frontier kapasite hacim odaklı olarak yeniden fiyatlanıyor.
Önce savunmacılar erişiyor
Erişim aşamalı. Google'ın Fairwind Programı'ndaki güvenilir siber savunmacılar Argon'a herkesten önce kavuşuyor ve ABD hükümeti gönüllü bir süreç kapsamında sürüm öncesi erişim alıyor. Binlerce Google çalışanı modeli halihazırda şirket içinde kullanıyor; verilen örneklerden birinde model, quantum hesaplama alt rutinlerini optimize ederken yayınlanmış bir baseline'ı %40 geride bıraktı. Ücretli API müşterileri ve Google AI Ultra abonelerinin sıradaki olduğu belirtiliyor; ancak bir tarih verilmiyor.
Akılda tutulması gereken uyarılar
Bloomberg, isimsiz kaynaklara dayanarak, bazı Google çalışanlarının modelin şirket içi performansını yetersiz bulduğunu bildirdi; Google bu anlatıyı reddetti. Google'ın metodoloji notu ayrıca bazı Argon skorlarının şirket içinde hesaplandığını, rakip skorlarının ise sağlayıcı yayınlarından ya da kamuya açık leaderboard'lardan geldiğini kabul ediyor; dolayısıyla farklar yön gösterici olarak okunmalı. Harvey'de kategori lideri olan %19,6 bile mutlak anlamda mütevazı kalıyor.
Neden önemli
Lansman koreografisi, leaderboard'dan daha önemli olabilir. Yetenekli bir zafiyet bulma modelini genel kullanıma açılmadan önce savunmacılara teslim etmek, ikili kullanım riskini bir politika dipnotu değil bir dağıtım sorunu olarak ele alıyor ve diğer laboratuvarların bu kalıbı kopyalaması muhtemel. Fiyatlandırma, frontier kapasitenin giderek bir hacim işi olarak satıldığına işaret ediyor. Benchmark yarışı ayrıca Argon'un farklarının en geniş olduğu profesyonel iş akışlarına — hukuk, finans, otomasyon — kaydı. Ancak erişim genişleyene ve bağımsız değerlendirmeler yapılana kadar buradaki her rakam Google'ın kendi raporlamasına ve birkaç ikincil aktarıma dayanıyor.
- #gemini
- #google-deepmind
- #llms
- #benchmarks
- #api-pricing