deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Z.ai'nin GLM-5.3-Flash'ı: 18B aktif parametreli ve 1M token bağlamlı 320B açık ağırlıklı MoE modeli

Z.ai, her token için yalnızca 18B parametre aktifleşen MIT lisanslı 320B parametreli bir MoE modeli olan GLM-5.3-Flash'ı yayınladı; model 1M token bağlam tutuyor ve coding ve agentic alanlarında frontier seviyesine yakın skorlar elde ediyor.

Z.ai'nin GLM-5.3-Flash'ı: 18B aktif parametreli ve 1M token bağlamlı 320B açık ağırlıklı MoE modeli

Z.ai ne yayınladı

Z.ai, GLM-5.3-Flash'ı 26 Ağustos 2026'da yayınladı: toplam 320 milyar parametreli, herhangi bir token için yalnızca yaklaşık 18 milyarının aktifleştiği açık ağırlıklı bir Mixture-of-Experts modeli. Bir dev.to analizine göre, GLM-5 serisinde doğuştan multimodal olan ilk model — metin, görüntü, video ve dosyaları girdi olarak alıyor — ve 128K token'a varan çıktıyla bir milyon tokenlık bir bağlam tutuyor. Eğitilmiş ağırlıklar MIT lisansıyla Hugging Face'te yer alıyor.

Flash varyantı, tam boyutlu GLM-5.3'ten on iki gün sonra geldi ve bilinçli olarak amiral gemisi değil. Dev.to, modeli tek bir liderlik tablosunun zirvesine oynamak yerine en düşük maliyetle en iyi yetenek elde etme hamlesi olarak tanımlıyor.

320B'lik bir model nasıl 18B'lik gibi çalışır

MoE yapısı modeli uzman alt ağlara bölüyor ve bir router her token için bunların yalnızca bir kısmını uyandırıyor. Ağ, 320B'lik bir modelin kapasitesini korurken her token, işlenmesi kabaca 18B'lik bir modelin mal olacağı kadar mal oluyor.

Dev.to'nun özetlediği Z.ai dokümantasyonu, hibrit bir attention sistemi ekliyor: en alakalı uzun menzilli bağlam için sparse attention, yerel bağımlılıklar için linear attention ile eşleştirilmiş — şirket bunu açık bir frontier modelde bir ilk olarak tanımlıyor. Bildirilen etkiler arasında, tam GLM-5.3'e göre 3,0 kat daha az attention hesaplaması ve 4,4 kat daha küçük KV cache var. IndexPool adlı bir bileşen indexer anahtar vektörlerini sıkıştırıyor; dev.to, bir milyon tokenlık bağlamın hiç ekonomik olarak sunulabilmesinin büyük nedenini buna bağlıyor. Model ayrıca ölçeklendirme verimliliğini artırmak için Z.ai'nin Manifold-Constrained Hyper-Connections dediğini kullanıyor ve 30 trilyon tokenlık multimodal bir külliyatla ön eğitimden geçti.

Sayılar, bir uyarıyla

Dev.to'nun aktardığı Z.ai lansman rakamları GLM-5.3-Flash'ı AutomationBench'de yüzde 48,8'e (GLM-5.2'deki yüzde 26,2'den yukarı), DeepSWE 1.1'de yüzde 63,4'e (yüzde 46,2'den yukarı), NL2Repo-Bench'de yüzde 56,3'e ve Toolathlon-Verified'da yüzde 78,4'e koyuyor. İlk ikisi agentic iş akışlarını ve uçtan uca yazılım mühendisliğini ölçüyor; son ikisi doğal dilden depoya üretimi ve araç kullanımını ölçüyor. Dev.to, bunların bağımsız sonuçlar değil, satıcının yayınladığı lansman rakamları olduğu konusunda açık.

Artificial Analysis Intelligence Index'te model 57 puan alıyor ve görev başına yaklaşık 0,045 dolarlık indirimli bir maliyetle sunuluyor; Z.ai, bu yetenek düzeyinin aylar önce kabaca on kat daha pahalıya mal olduğunu söylüyor. Üçüncü taraf sağlayıcılar milyonda girdi token'ı için yaklaşık 0,15 dolar, milyonda çıktı token'ı için 0,50 dolar ücret alıyor; dev.to bu rakamları Eylül 2026 başında doğruladı ve değişme ihtimali yüksek olduğunu belirtti.

Yerli silikon üzerinde gizli bir lansman

Açıklamadan önce Z.ai'nin modeli bildirildiğine göre OpenRouter ve OpenCode üzerinde ox-alpha kod adıyla anonim olarak çalıştırdı ve kimin yaptığını kimse bilmeden o haftanın en çok kullanılan modeli oldu. Daha önemli ayrıntı ise tüm bu trafiğin Nvidia donanımı yerine Çin yapımı AI çiplerinde, hibrit mimari için özel olarak inşa edilmiş bir inference motoruyla sunulması; dev.to'nun bildirdiğine göre hızlar ana akım Nvidia kurulumlarına yakın seviyedeydi. Kurucular için bu, jeopolitikten çok tedarik açısından önemli: uygun sunum donanımının artması daha fazla inference kapasitesi anlamına geliyor ve bu da token başına fiyatları aşağı çeken güçlerden biri.

Döngünün içinde görme

Görme yeteneği sonradan eklenmiş değil doğuştan olduğu için model, kendi çıktısını — render edilmiş sayfaları, ekran görüntülerini, grafikleri, belgeleri ve videoyu — coding döngüsünün içinde inceleyebiliyor ve yalnızca metin tabanlı bir modelin kaçıracağı görsel sorunları yakalayabiliyor. Dev.to, bozuk bir arayüz ekran görüntüsünden görsel hata ayıklamayı, 1M'lik pencere boyunca belgeden elektronik tabloya hatları, uzun video analizini ve tasarımdan koda dönüşümü pratik getiriler olarak listeliyor.

Kurucuların dikkat etmesi gerekenler

API kullanıcıları modeli ucuz bir varsayılan katman olarak görebilir ve başarısız deneme başına sentler ödeyerek mevcut iş atlarına karşı benchmark edebilir. Kendi sunucusunu kullananlar MIT lisansını ve herkese açık ağırlıkları elde ediyor, ancak donanım gereksinimleri açısından 18B aktif rakamı yanıltıcı: 320B'lik ağırlıkların tamamı yine de belleğe sığmak zorunda. Ayrıca model katı anlamda open source değil open-weight — eğitim verisi ve eğitim kodu yayınlanmıyor.

Neden önemli

GLM-5.3-Flash üç kaymayı tek bir sürümde birleştiriyor. Emtia fiyatlarıyla frontier seviyesine yakın coding ve agentic davranış sergiliyor ve Artificial Analysis endeksinde görev başına birkaç sente 57 puan alıyor. Mimarisı — MoE seyrekliği artı hibrit attention artı KV sıkıştırması — bir milyon tokenlık bağlamı teorik değil sunulabilir kılıyor. Ve gizli lansmanı, en iyi açık modellerden birinin Nvidia dışı silikonda üretim ölçeğinde çalışabileceğini gösterdi. AutomationBench'in tek nesilde 26,2'den 48,8'e sıçraması izlenecek rakam, çünkü denetimsiz çok adımlı agent'lar bütçeyi asıl türlü şeylerdir. Bağımsız testler Z.ai'nin rakamlarını doğrularsa, açık, ucuz ve kendi sunucusunda barındırılabilir bir modelin sunmak zorunda olduğu tablo henüz yükselmiş oldu.

  • #open-weights
  • #mixture-of-experts
  • #large-language-models
  • #long-context
  • #ai-agents

İlgili yazılar