· kaynak dev.to (home feed)
Z.ai, Ox Alpha'nın GLM-5.3-Flash olduğunu açıkladı: onda bir fiyatla açık kaynaklı multimodal bir model
Z.ai, anonim 'Ox Alpha' modelinin GLM-5.3-Flash olduğunu doğruladı: 320 milyar parametreli, MIT lisanslı, 1 milyon token bağlamlı, hibrit dikkat mekanizmalı ve agresif fiyatlı multimodal bir model.

Ox Alpha'nın kimliği ortaya çıktı
Yaklaşık bir hafta boyunca geliştiriciler OpenCode ve OpenRouter üzerinde "Ox Alpha" adıyla listelenen bir modeli çözmeye çalıştı. Model 20 Ağustos'ta, adı açıklanmış bir sahibi olmadan, ücretsiz kullanıma sunulmuş; bir milyon tokenlık bağlam penceresi ve yerel görüntü ve video girdisiyle gelmişti. dev.to'ya göre bağımsız araştırmacılar tokenizer'ını parmak iziyle tanımladı ve sıkıştırma analizleri yürüttü; modeli yüksek güvenle Z.ai'nin GLM ailesine bağladılar. 26 Ağustos'ta Z.ai tahmini doğruladı: Ox Alpha, GLM-5.3-Flash'tı; şirket, resmi lansmandan önce gerçek dünya geri bildirimi toplayabilmek için modeli anonim olarak yayınlamıştı.
Ucuz sunum için şekillendirilmiş bir Mixture-of-Experts modeli
GLM-5.3-Flash, GLM-5 serisinde yerleşik olarak multimodal ilk model; dev.to, önceki GLM-5.2 ve GLM-5.3 sürümlerinin yalnızca metin odaklı olduğunu ve bu nedenle kullanıcı şikayeti aldığını belirtiyor. Model, toplam 320 milyar parametreye sahip ama token başına yalnızca 18 milyar aktif parametre kullanan bir Mixture-of-Experts tasarımı; GLM-4.5 serisinin 92 katmanına karşılık 45 katmanlı bir yığına sahip. Z.ai, daha sığ yapıyı 30 trilyon tokenlık multimodal ön eğitim külliyatı ve Manifold-Constrained Hyper-Connections adını verdiği bir ölçeklendirme tekniğiyle telafi etti.
En dikkat çekici mühendislik iddiası dikkat tasarımı. Z.ai bunu, seyrek dikkat (sparse attention) ve doğrusal dikkati (linear attention) tek bir mimaride birleştiren ilk açık kaynaklı uç model olarak tanımlıyor: doğrusal dikkat durum modellemesi (state modeling) yoluyla yerel bağımlılıkları yakalarken, hafif bir indexer küresel bağlamı geri getiriyor. Bir IndexPool mekanizması, ağırlıklı pooling yoluyla dört indexer anahtar vektörünü tek bir vektöre sıkıştırıyor. GLM-5.3 ile karşılaştırıldığında Z.ai, dikkat hesaplamada 3 kat ve KV cache boyutunda 4,4 kat azalma bildiriyor.
Uyarılarla birlikte benchmark tablosu
dev.to, tüm rakamların satıcı tarafından yayınlandığını, bağımsız olarak doğrulanmadığını ve karşılaştırma tablolarının birçok güçlü modeli atladığını vurguluyor. Bu uyarıyla birlikte: Z.ai, GLM-5.3-Flash'ın indirimli katmanda görev başına yaklaşık 0,045 dolara Artificial Analysis Intelligence Index v4.1.1'de 57 puan aldığını söylüyor. Artificial Analysis'ın kendi model sayfası, Terminal-Bench v2.1, GPQA Diamond ve Humanity's Last Exam dahil dokuz değerlendirmeyi kapsayan indeksin bileşimini belgeliyor.
Kodlama ve ajan temelli işlerde Z.ai'nin rakamları GLM-5.2'ye göre net sıçramalar gösteriyor: DeepSWE v1.1 46,2'den 63,4'e yükseliyor ve Opus 4.8'in 58,0'ının önünde; AutomationBench 26,2'den 48,8'e neredeyse ikiye katlanıyor; Terminal-Bench 2.1, Opus 4.8'in 85,0'ına hemen arkasından 84,3'e ulaşıyor; Toolathlon Verified 78,4 ve Agents' Last Exam 26,3 puan alıyor, ikisi de kapalı模型的 liderlerine yakın. Belirgin zayıf nokta NL2Repo: GLM-5.3-Flash 56,3 puan alırken Opus 4.8 69,7 puanla önde. dev.to'nun da belirttiği gibi, doğal dil açıklamasından entire bir depo üretmek hâlâ tam anlamıyla kapalı-uç (closed-frontier) bölgesi.
Kodlama döngüsüne göre şekillendirilmiş görme yetisi
Z.ai multimodaliteyi görüntü işlemeden çok bir geri bildirim döngüsünü kapatma olarak çerçeveliyor: yalnızca metin tabanlı bir model, kendi frontend kodunun ürettiği bozuk yerleşimi göremez. Eğitimde modelin kendi render edilmiş çıktısını inceleyip yinelemeli olarak iyileştirdiği self-visual judgment pipeline'ları ve ortam geri bildirimli pekiştirmeli öğrenme kullanıldığı bildiriliyor. Görme sonuçları da buna göre bölünüyor. Belge ve grafik akıl yürütme güçlü — OfficeQA Pro'da 62,4 puan, Opus 4.8'in 48,9'unun oldukça önünde; CharXiv Reasoning'de 89,4 ile Opus 4.8'e denk sayılır. Saf video anlama geride: BabyVision 53,4'te kalırken Gemini 3.7 Flash 70,9'da; MVbench ve MMVU de her ikisinde Gemini'nin gerisinde.
Yerli Çin çiplerinde çalışıyor
Kolayca gözden kaçan bir altyapı detayı: önizleme haftası boyunca model, NVIDIA donanımı yerine yurt içinde üretilmiş Çin yapay zekâ çiplerinden oluşan bir kümede sunuldu. Bu çipler özellikle 1 milyon tokenlık bağlamlarda bellek kapasitesi ve bant genişliği açısından kısıtlı olduğundan Z.ai, SGLang üzerine W8A8 quantization, hibrit INT8/FP8/BF16 cache quantization, Layer Split ve ayrıştırılmış (disaggregated) Encode-Prefill-Decode mimarisiyle özel bir inference engine kurdu. Şirket, ilk baseline'a göre uçtan uca 3 kat sunum iyileştirmesi ve token başına maliyetin ana akım NVIDIA GPU'larıyla karşılaştırılabilir olduğunu bildiriyor. İlginç bir şekilde, bu optimizasyon işinin önemli bir kısmı, mühendislere kernel yazma ve darboğaz teşhisi konularında yardımcı olan GLM-5.3 destekli bir altyapı ajanıyla hızlandırıldı.
Fiyatlandırma ve erişim
API fiyatları milyon girdi tokenı başına 0,15 dolar, milyon çıktı tokenı başına 0,50 dolar ve önbelleğe alınmış girdi için 0,03 dolar — kabaca GLM-5.3'ün 1,40/4,40 dolarlık tarifelerinin onda biri. GLM Coding Plan, aynı katmanda GLM-5.3'ün üç katı kullanılabilir kota kazanıyor ve yoğun olmayan saatlerdeki kullanım standart puanların yarısına mal oluyor. Ağırlıklar MIT lisansıyla HuggingFace'te yayımlandı; yerel dağıtım için SGLang, vLLM ve TokenSpeed destekleniyor.
Neden önemli
Üç şey bunun bir tanıtım numarası olmasının ötesine taşıyor. Anonim test yöntemi Z.ai'ye lansmandan önce tarafsız gerçek dünya geri bildirimi toplama imkânı verdi; topluluğun parmak izi çalışması da böyle bir anonimliğin ömrünün ne kadar kısa olduğunu gösterdi. Ekonomi daha da önemli: MIT lisanslı, milyon token bağlamlı, yerleşik multimodal bir modelin öncekinden onda bir fiyata sunulması, uca yakın yetenekleri sıradan projelerin erişimine sokuyor. Ve donanım hikâyesi en önemlisi — 1M tokenlık bir model NVIDIA dışı Çin çiplerinde rekabetçi maliyetle sunulabiliyorsa, uç çıkarımın (frontier inference) NVIDIA GPU'ları gerektirdiği varsayımı zayıflıyor ve bunu mümkün kılan hibrit dikkat tasarımı artık herkesin inceleyip yeniden kullanmasına açık.
- #open-source
- #language-models
- #benchmarks
- #inference
- #z-ai
İlgili yazılar
- FineTune Studio, Qwen3-1.7B'yı yaklaşık 3,2 GB VRAM ile QLoRA üzerinden fine-tune ediyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- Apple Vision OCR yerel bir 27B VLM'den 300 kat hızlı çalışıyor ama tablo yapısını yok ediyor