deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Z.ai'nin GLM-5.3'ü, değişmeden kalan 743 milyar parametreli taban üzerindeki post-training sayesinde büyük kazanımlar iddia ediyor

dev.to'da yayımlanan bir yazıya göre Z.ai'nin GLM-5.3'ü, GLM-5.2 ile aynı 743 milyar parametreli tabanı koruyor ama post-training sayesinde kodlama ve güvenlikte büyük ilerleme kaydediyor; açık weights de söz verildi.

Z.ai'nin GLM-5.3'ü, değişmeden kalan 743 milyar parametreli taban üzerindeki post-training sayesinde büyük kazanımlar iddia ediyor

İddia

Ağustos 2026'da, dev.to'da yayımlanan bir yazıya göre Z.ai, GLM-5.3'ü piyasaya sürdü — selefi GLM-5.2 ile tamamen aynı 743 milyar parametreli mimariye sahipken kodlama ve güvenlik performansında sıçrama yaşatan bir model. Yazı, programlama yeteneğinde yaklaşık %50'lik bir artışa ve küresel siber güvenlik benchmark'larında zirveye işaret ediyor ve tüm bunları daha büyük bir modele değil, pre-training sonrasına bağlıyor.

Post-training kaldırac olarak

Hikayenin özü post-training ölçeklendirmesi: modelin ilk eğitim koşusu tamamlandıktan sonra uygulanan iyileştirmeler. dev.to yazısına göre Z.ai üç kaldıraca odaklandı — modelin elindeki verilerden nasıl öğrendiğini rafine etmek, veri setini büyütmeden veri kalitesini yükseltmek ve çok daha büyük ölçekte reinforcement learning çalıştırmak. Yazıda alıntılanan Z.ai'nin yaklaşım özeti şöyle: ders kitabı aynı kaldı, öğretim yöntemleri iyileşti.

Teknoloji yığını

Başarı üç bileşene atfediliyor. IndexShare, uzun bağlamlı işlemlerde bilgi kaybını sınırlayan bir long-context işleme mimarisi olarak tanımlanıyor. SAO (Single-rollout Asynchronous Optimization), uzun vadeli problemler için tasarlanmış bir reinforcement learning algoritması; modelin izole adımlar yerine bütün yörüngelerden öğrenmesini sağlıyor. Slime ise hattı endüstriyel ölçeğe taşıyan büyük ölçekli asenkron RL eğitim çerçevesi.

Benchmark tablosu

Yazıda raporlanan sayılar:

  • CyberGym, zafiyet tespiti: %77,2'den %84,5'e, küresel birincilik.
  • ExploitBench, exploit akıl yürütme: %24,4'ten %54,4'e, hâlâ %78,0 ile Mythos 5'in gerisinde.
  • Terminal-Bench 3.0: 4,6'dan 28,3'e, açık kaynak modeller arasında birincilik.
  • DeepSWE v1.1: 46,2'den 66,9'a, açık kaynak modeller arasında birincilik.
  • GDPval-AA v2: 15.081'den 17.694'e, Kimi K3'ün önünde.

Yazının kendisinin de işaret ettiği örüntü bir asimetri: GLM-5.3, zafiyetleri tespit etmede, bunların nasıl exploit edileceğini akıl yürütmedekinden çok daha güçlü.

Gerçek dünya testleri

Benchmark'ların ötesinde, yazıya göre GLM-5.3, 269 gerçek dünya projesinde çalıştırıldı ve 2.436 zafiyet ortaya çıkardı; arasında 1983'ten beri fark edildiği söylenen bir DNS protokol hatası da vardı. Bu keşif incelemelerden sağlam çıkarsa, bir benchmark tablosunun çok ötesinde internet altyapısı için etkileri olan türden bir bulgu olur.

Kısıtlamalarla birlikte açık kaynak planları

Yazıya göre Z.ai, duyurudan sonra iki hafta içinde GLM-5.3 weights'lerini açık kaynak yapmayı, yanına da model yeteneklerine kontrollü erişim için bir "Trusted Access" programı ve topluluk kaynaklı güvenlik yönetişimi için bir "Open Source Shield" girişimi sunmayı planlıyor. Aynı yazı, bazı yeteneklerin yayımdan sonra bile kısıtlı kalabileceği konusunda uyarıyor. Weights'ler tarif edildiği gibi gelirse, GLM-5.3'ün mevcut en güçlü açık kaynak kodlama modeli olduğu söylenebilir.

Uyarılar

Kaynak, sınırları konusunda alışılmadık derecede açık. Her benchmark rakamı satıcı tarafından raporlanmış ve bağımsız olarak doğrulanmamış; weights'ler yazının kaleme alındığı anda hâlâ kamuya açık değildi ve tespit-exploit arasındaki fark sürüyor. Geliştiriciye dönük karşılaştırmalar — Claude Fable 5 ve GPT-5.6 Sol'ye yaklaşan kodlama performansı ve görev başına Opus 4.8'in yaklaşık 120K'ına karşı kabaca 50K token kullanımı — da test edilmiş sonuçlar değil, doğrulanmamış iddialar.

Neden önemli

GLM-5.3'ün sayıları bağımsız değerlendirmeden sağlam çıkarsa, bu yayım; eğitim yöntemi inovasyonunun parametre büyümesinin yerine geçebileceğine dair somut bir kanıt olur — frontier pre-training koşularının milyarlara mal olduğu bir anda yeteneğe giden çok daha ucuz bir yol. Aynı taban modeli koruyup çıktıyı iyileştirmek, doğrudan daha iyi inference ekonomisine de çevriliyor. Ve açık weights sözü verildiğinden, kod incelemesi ve zafiyet tespitinde bu kadar güçlü bir model, güvenlik araçlarında hızla varsayılan hale gelebilir — ne kadar açık bir açık kaynak güvenlik modelinin olabileceğini ise "Trusted Access" kısıtlamaları test edecek.

  • #z-ai
  • #glm
  • #post-training
  • #reinforcement-learning
  • #open-source
  • #benchmarks

İlgili yazılar