· kaynak Hacker News – Front Page (native)
Z.ai, GLM-5.3'ü açık ağırlıklı olarak yayınladı; kodlama ve siber güvenlik karşılaştırmalarında açık kaynak SOTA iddiası
Z.ai, GLM-5.3'ü açık ağırlıklar olarak yayınladı; GLM-5.2 temel modelini yeniden kullanıyor ve tüm kazanım post-training'den geliyor. Şirket, kendi kod karşılaştırmasında yüzde 50'lik artış ile Terminal Bench 3.0, Agents' Last Exam ve CyberGym'de açık kaynak SOTA iddia ediyor.
Z.ai, GLM-5.3'ü açık ağırlıklı (open-weight) bir model olarak yayınladı; ağırlıklar Hugging Face üzerindeki zai-org organizasyonu altında paylaşıldı. Model kartına göre bu sürüm, GLM-5.2'nin temel modelini yeniden kullanıyor; yani iddia edilen her iyileşme yeni bir pre-training çalışmasından değil, post-training'den geliyor. Z.ai'nin öne çıkardığı kazanımlar karmaşık kodlama ve uzun soluklu agentic işlerde.
Z.ai'nin iddiaları
Şirket, kendi iç ölçümleri olan Z.ai Code Bench üzerinde GLM-5.2'ye göre yüzde 50'lik bir iyileşme bildiriyor ve GLM-5.3'ü kodlama için en güçlü açık ağırlıklı model olarak nitelendiriyor; Terminal Bench 3.0 ve Agents' Last Exam dahil olmak üzere kamuya açık karşılaştırmalarda açık kaynak modeller arasında sınıfının en iyi sonuçlarını aldığını belirtiyor.
Yayınlanan karşılaştırma tablosundan seçilmiş sonuçlar:
- Terminal Bench 3.0: 28.3, GLM-5.2'de 4.6 idi. Kapalı modeller burada hâlâ önde; Fable 5 33.7 ve GPT-5.6 Sol 34.6 puanla lider.
- Terminal Bench 2.1: 88.2'e karşı 81.0; Kimi K3 ile 88.3'te eşit düzeyde ve GPT-5.6 Sol'un 88.8'inin hemen gerisinde.
- DeepSWE v1.1: 66.9'a karşı 46.2; Fable 5 (69.7) ve GPT-5.6 Sol (72.7) hâlâ önde.
- Agents' Last Exam: 28.5'e karşı 23.8; GPT-5.6 Sol'un 28.6'sının kıl payı gerisinde.
- SWE-Marathon v1.1: 42.5'e karşı 19.4; ancak Kimi K3 48.1 ve Opus 4.8 48.8 ile daha yüksek puan aldı.
Tablonun genelindeki örüntü şu: GLM-5.3, daha zor ve uzun süren test setlerinde selefinin skorlarını kabaca ikiye katlıyor ve kapalı frontier modellere açığı büyük ölçüde kapatıyor, ancak tamamen kapatmıyor.
Siber yetenek beklenenden hızlı ortaya çıktı
En olağandışı açıklama saldırgan güvenlikle (offensive security) ilgili. Z.ai, post-training'i ölçekledikçe siber yeteneğin öngördüklerinden daha hızlı büyüdüğünü söylüyor. Güvenlik açığı keşfini ölçen CyberGym'de GLM-5.3, GLM-5.2'nin 77.2'sine karşı 84.5 puan aldı; bu, tablodaki en yüksek skor ve GPT-5.6 Sol (83.6), Fable 5 (83.8) ile Kimi K3'ün (80.0) önünde.
Model kartına göre en büyük kazanım sömürü (exploitation) zincirinin ileri aşamalarında yer alıyor. ExploitBench 24.4'ten 54.4'e sıçrıyor; ExploitGym ise iki saatlik bütçeyle 105, altı saatlik bütçeyle 130 puana ulaşıyor; GLM-5.2'de bu değerler 29 ve 39 idi. Kapalı modeller tam sömürü konusunda geniş bir avantajı koruyor: Fable 5 ExploitGym'de 181/247, GPT-5.6 Sol 216/293 bildiriyor; ExploitBench'de ise sırasıyla 78.0 ve 76.5 puanlara sahipler.
Ağırlıklar indirilebilir olduğu için bu yetenek bir API kapısı olmadan dağıtılıyor. Model kartı, siber sonuçlara bağlı ek erişim kısıtlamaları veya güvenlik filtrelemesi tanımlamıyor.
Yerel olarak çalıştırma
Model kartı desteklenen serving framework'lerini listeliyor: SGLang, vLLM, TokenSpeed, Transformers, KTransformers ve Unsloth. Ascend NPU donanımı vLLM-Ascend, xLLM ve SGLang üzerinden destekleniyor.
İki yapılandırma notu öne çıkıyor. reasoning_effort parametresi low, high ve max değerlerini kabul ediyor ve varsayılanı max; Z.ai, leaderboard sonuçlarını yeniden üretirken varsayılanın korunmasını öneriyor. Sohbet şablonundaki clear_thinking seçeneği varsayılan olarak false ve Z.ai, sohbet senaryoları için açıkça clear_thinking=true geçirilmesini tavsiye ediyor.
Rakamlar hakkında uyarılar
Neredeyse tüm sonuçlar Z.ai tarafından kendi bildirdiği sonuçlar. Birçok değerlendirme Claude Code harness'i içinde koştu ve HLE değerlendirmesinde hakem olarak GPT-5.6-luna kullanıldı. İki satır dış taraflardan geliyor: Artificial Analysis GDPval-AA v2'yi ölçtü ve Proximal FrontierSWE'yi çalıştırdı. Dipnotlarda ayrıca Z.ai'nin PostTrainBench ve SWE-Marathon'daki hile önleme denetimlerini değiştirdiği, çok geniş bulduğu örüntü eşleme denetimlerini LLM tabanlı incelemeyle değiştirdiği açıklanıyor.
Kayıtların kapsamına da dikkat edin: açık kaynak modeller arasında en iyi olmak genel liderlik anlamına gelmiyor. Fable 5, PostTrainBench'de 39.8'e karşı 41.8 ile önde ve kapalı modeller Terminal Bench 3.0, DeepSWE ve sömürü setlerinde ileride kalmaya devam ediyor.
Neden önemli
Kodlama agent'lerinde kapalı frontier sistemleriyle yarışan, indirilebilir bir model; kendi sunucularında barındırma, veri kontrolü veya öngörülebilir çıkarım (inference) maliyeti gereken ekipler için hesaplamayı değiştiriyor. Bu sürüm ayrıca yalnızca post-training'in bugün ne kadar alan sunduğunu gösteriyor: aynı temel model, en zorlu setlerde kabaca iki katına çıkan skorlar sunuyor. Ve hızla ortaya çıkan sömürü yeteneği, açık ağırlıklı sürümleri yalnızca bir mühendislik sorunu değil, aynı zamanda bir yönetişim sorunu haline getiren tam da o türde çift kullanımlı bir beceri. Bağımsız değerlendirmeler ortaya çıkana kadar karşılaştırma tablosunun en iyi şekilde Z.ai'nin kendi modeli hakkındaki anlatısı olarak okunması gerekiyor.
- #open-weights
- #llm
- #coding-agents
- #benchmarks
- #cybersecurity
İlgili yazılar
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- SWE-Bench ProMax: en iyi model büyük çok dilli refactoring görevlerinin yalnızca yüzde 41,2'sini çözebiliyor
- Unit 42, Meksika ve Brezilya hedeflerine yapılan LLM destekli sızma girişimlerini izledi