deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Open-weight GLM-5.3, 28 Ed-o-meter görevinin tamamını GPT-5.5'in beşte biri maliyetle geçti

Bağımsız bir 28 görevlik benchmark, open-weight GLM-5.3 modelini tam çalıştırma başına 0,28 dolarla — yani gpt-5.5'in yaklaşık beşte biri maliyetle — yüzde 100 başarı oranına ulaştırdı; ana bedeli ise daha yavaş ilk token süresi.

Open-weight GLM-5.3, 28 Ed-o-meter görevinin tamamını GPT-5.5'in beşte biri maliyetle geçti

Open-weight model bağımsız liderlik tablosunun zirvesinde

23 Ağustos 2026'da Hacker News'in ana sayfasında ortaya çıkan bağımsız bir benchmark, open-weight bir model olan GLM-5.3'ün 28 gerçek dünya görevinin tamamını geçtiğini — bunu başaran ilk model olduğunu — ve bunu OpenAI'nin gpt-5.5'inin aynı iş yükü için harcadığının kabaca beşte biri maliyetle yaptığını bildiriyor. Kerv'de uygulayıcı yapay zeka mimarı Ed Yau'nun yönettiği Ed-o-meter liderlik tablosuna göre GLM-5.3, tam seti gpt-5.5'in 1,43 dolarına karşı 0,28 dolara tamamladı ve sitenin kalite rubriğinde 9,3 puan alarak test edilen 17 model arasında üçüncü en yüksek skor elde etti.

Tek bir harness, deterministik notlandırma

Ed-o-meter her modeli aynı 28 görevden, özdeş prompt ve API çağrılarıyla geçiriyor; tümü tek bir OpenRouter streaming yolu üzerinden yönlendiriliyor ve sırayla çalıştırılıyor. Notlandırma ikili ve otomatik; yalnızca bir LLM tarafından değerlendirilen rubrik bileşeni hariç — sitenin dediğine göre bu bileşenin önyargısı yok sayılmak yerine belgeleniyor. Görevler beş kategoriyi kapsıyor — kodlama, veri, gerçek dünya işleri, güvenlik ve araç kullanımı — ve tüm seti çalıştırmanın maliyeti yaklaşık 30 dolar. Harness, görevler ve denetleyiciler Featherbench adıyla MIT lisansıyla open source; böylece herkes seti yeniden çalıştırıp sayıları doğrulayabilir.

GLM-5.3'ün bedeli hız: ilk tokena medyan 16,3 saniye, gpt-5.5 içinse 13,2 saniye. Ancak OpenAI modeli, temiz bir güvenlik kaydı tutarken gerçek dünya kategorisinde yalnızca yüzde 89'a ulaşabildi.

Başarısızlık gibi görünen güvenlik filtreleri

İki Anthropic ailesi model, sitenin yetenekten çok ölçüm artefaktlarına atfettiği skorlar aldı. Opus-5, varsayılan panelde 9,4 ile en iyi rubrik puanını kaydetti; gerçek dünya ve güvenlik görevlerinde yüzde 100 yaptı ama kodlamada yalnızca yüzde 43 kaldı — çünkü sitenin belirttiğine göre, sağlayıcı tarafındaki bir sınıflandırıcı tek bir token üretilmeden önce dört zararsız hata ayıklama görevini engelledi. Fable-5 benzer bir duvara çarptı, beş görevi düpedüz reddetti ve yüzde 79 ile tablonun en dibine ortak oldu. Yau bunu iki modelden birinin tuhaflığı değil, series-5 hattına yayılan bir risk olarak görüyor ve opus-5'ün direndiği bir saldırıyı işaretlediği için iki kez cezalandırıldığını not ediyor.

Güvenlik kategorisi tablodaki en keskin ayrışmayı yarattı. Üç gpt-5.6 varyantı, 12 jailbreak test hücresinin 11'inde bir jailbreak kanaryası üretti ve güvenlik başarı oranları yüzde 33–50'de kaldı. Claude üçlüsü ve gpt-5.5 ise tertemiz geçti.

Tablonun bütçe ucundakiler

Yüksek hacimli arka plan işleri için site, görev başına 0,0023 dolar ve 5,3 saniyelik medyan ilk token süresiyle gpt-5.6-luna'yı seçiyor — ama yüzde 79'luk genel geçme oranını ve yüzde 33'lük güvenlik skorunu, her çıktının doğrulanması ve modelin güvenilmeyen promptlardan uzak tutulması gerektiğinin gerekçeleri olarak işaret ediyor. Haiku-4-5, görev başına 0,0044 dolarla daha yüksek doğruluklu alternatif; yüzde 96 genel oran ve 0,9 saniyelik yanıt süresi var. Deepseek-v4-pro aynı yüzde 96'ya görev başına 0,0029 dolara ulaşıyor ama ilk tokena medyan 40 saniyeyle tablonun en yavaşı ve site bu yüzden onu etkileşimli hiçbir iş için uygun görmüyor. Kimi-k3, 9,5 ile rubriğin zirvesinde ve genel oranı yüzde 96; ancak 26,4 saniyelik medyan gecikme ve veri görevlerindeki yüzde 75'lik performans onu etkileşimsiz kullanımla sınırlıyor.

Sayılara dair uyarılar

Sonuçlar model başına 28 görev üzerinde tek bir denemeden geliyor ve site bu nedenle geniş Wilson güven aralıkları bildiriyor. Çaba ve akıl yürütme ayarları sabitlenmiş ve her sayının yanında yayımlanmış durumda; reddedilenler sessizce başka bir modelde yeniden denenmek yerine kaydediliyor ve yönlendirme kilitli, yani quantize varyantlara sessiz geri dönüş olamıyor.

Neden önemli

Bu sonuç tek bir denemenin ötesinde doğrulanırsa, pratik görevlerde sınır kapalı modellerle eşleşen ya da onları geçen bir open-weight modelin işletme maliyetinin beşte biriyle bunu yapması, model seçiminin ekonomisini değiştirir ve self-hosting argümanını güçlendirir. Bu çalışma, LLM liderlik tablolarını okuyan herkes için iki daha geniş ders daha taşıyor: sağlayıcı tarafındaki güvenlik filtreleri, model yeteneği hakkında hiçbir şey söylemeden bir benchmark skorunu çökertebilir ve en ucuz seçenekler gerçek güvenlik riski taşıyabilir. Bir operatörün 28 görevlik turu yararlı bir sinyaldir — bir hüküm değil.

  • #llm
  • #benchmark
  • #open-source
  • #ai

İlgili yazılar