· kaynak dev.to (home feed)
GLM-5.3-Flash'ın kıyaslamalarda Claude Opus'a eşit olduğu, token başına fiyatının ise yaklaşık 1/40'ı olduğu bildiriliyor
dev.to'daki bir analiz, Zhipu'nun açık kaynak GLM-5.3-Flash modelinin Artificial Analysis endeksinde Claude Opus 4.8 ile eşit skor aldığını ve token başına yaklaşık kırkta bir ücret aldığını söylüyor; bu da API maliyeti kararlarını yeniden şekillendirebilir.

Ucuz bir açık model, bir amiral gemisiyle eşit skor aldı
Van Massey'nin dev.to'daki yayını, LLM API bütçesi yöneten herkesi ilgilendirecek bir iddiayı ortaya koyuyor: Zhipu AI'nin MIT lisanslı, açık kaynak, toplam 320 milyar parametreli ve 18 milyar aktif parametreli mixture-of-experts modeli GLM-5.3-Flash, Artificial Analysis Intelligence Index'te Claude Opus 4.8 ile aynı skoru alırken, Opus'un resmi token başına ücretinin kabaca kırkta birini talep ediyor.\n Yazıya göre model, resmi olarak tanımlanmadan önce bile dikkat çekti. OpenRouter'da "Ox Alpha" adıyla anonim olarak yayınlandı, ilk gün platformun liderlik tablosunun zirvesine yerleşti ve altı gün içinde yaklaşık 62 trilyon token hizmet verdi.
Fiyat tablosu
dev.to yazısı, Zhipu'nun GLM-5.3-Flash için milyonunca token başına yayımladığı ücretleri sıralıyor:
- Uluslararası: girdi için 0,30 $ ve çıktı için 1,20 $; çıktı ücreti sınırlı süreli yarı fiyat kampanyası sırasında 0,60 $'a düşüyor.
- Yurt içi (Çin): girdi için ¥0,8 ve çıktı için ¥2,8.
Yazar, uluslararası fiyatlandırmayı milyonunca token başına yaklaşık 0,14 $/0,28 $ listeleyen DeepSeek V4 Flash ile aynı düşük maliyetli banda yerleştiriyor; ancak daha yüksek bir zekâ skoruyla: AA endeksinde 57'ye karşı DeepSeek V4 Pro için 53. Yurt içinde Flash'ın, tam GLM-5.3 amiral gemisi katmanının yaklaşık onda birine, kampanya döneminde ise yirmide birine mal olduğu söyleniyor. Yazıya göre Zhipu ayrıca toplam faturanın düzeltilmiş DeepSeek V4-Flash'ın altında kaldığını iddia ediyor.
Fiyatın ötesinde model, kabaca 1,04 milyon tokenlık bir context window ile metin, görsel, video ve dosyalar için native multimodal desteğiyle öne çıkıyor.
Yazı somut bir örnek veriyor: bir milyon girdi tokenı ve bir milyon çıktı tokenı tüketen bir agent oturumu standart ücretlerle 1,50 $, kampanya süresince 0,90 $ tutarında. Büyük bir kod tabanını tekrar tekrar okuyup on milyon girdi tokenı harcayan bir iş yükü 3,00 $ tutarında. Yazarın vurguladığı nokta, uzun context'li agent'ları ekonomik olarak sürdürülebilir kılan şeyin ucuz girdi tokenları olduğudur; çünkü durumu biriktirip tekrar göndermek artık faturanın büyük kısmını oluşturmaz.
Yazının kendisinin dile getirdiği uyarılar
dev.to analizi manşetteki orana karşı kayda değer ölçüde temkinli ve uyarıları sayılar kadar önemli:
1/40 figürü Opus 4.8'ın liste fiyatıyla karşılaştırılıyor. Müzakere edilmiş kurumsal veya toplu indirimlere sahip ekipler, gerçek hayatta daha küçük bir fark görecek.
Token başına fiyat, görev başına fiyat değildir. Daha ucuz modelin bir işi tamamlamak için daha fazla yeniden deneme, daha büyük context yeniden gönderimleri veya tekrarlanan tool çağrılarına ihtiyacı varsa etkin avantaj küçülür. Yön gerçek; büyüklük iş yüküne bağlı.
Yarı fiyatlı çıktı ücreti geçicidir; bu yüzden bütçeler standart 0,30 $/1,20 $ ücretleri üzerinden kurulmalı.
Özdeş endeks skorları, belirli görevlerde özdeş davranış garantisi değildir ve yazı, DeepSeek ekosisteminin daha olgun olduğunu belirtiyor. O araçlara yatırım yapmış ekipler, tek bir kıyaslama sayısına dayanarak geçiş yapmadan önce kendi değerlendirmelerini koşmalı.
Pratik öneriler
Yazar ölçülü bir çıkış öneriyor: çıktı kalitesini mevcut bir modelle gerçek görev karışımları üzerinde değerlendirmek için modelin ücretsiz katmanını (günde 200 istek) kullanın; üretim trafiğinin bir dilimini ücretli katmana yönlendirin ve token başına maliyet yerine tamamlanan görev başına maliyeti karşılaştırın, yeniden denemeleri ve context büyümesini izleyin; ince hataların pahalıya mal olduğu code review, finansal veya hukuki çıktılar için daha yüksek yetenekli bir modeli denetçi olarak tutun; ve GLM-5.3-Flash OpenAI uyumlu protokolü konuştuğu için, Claude, GPT, DeepSeek ve Kimi'nin yanı sıra bir gateway'nin arkasına yerleştirin ki modeller kod değişikliği olmadan rota başına değiştirilebilsin.
Neden önemli
Bu kıyaslama seviyesindeki bir model gerçekten amiral gemisi ücretlerinin bir kesitine mal oluyorsa, birçok yapay zekâ ürününün varsayılan mimarisi değişir. Doğası gereği token aç olan agentic iş yükleri çok daha agresif çalıştırılabilir hale gelir ve pahalı frontier modeller, yük çekici olmaktan çıkıp son bir kalite kapısına dönüşür. MIT lisansı, kapalı modellerin sunamayacağı bir self-hosting seçeneği ekliyor. Ama dürüst okuma şu: token başına oranlar bir başlangıç noktasıdır, bir sonuç değil — kıyaslama eşitlikleri görev düzeyinde garanti değildir, kampanyalar sona erer ve gerçek ölçüt kendi iş yükünüzdeki tamamlanan görev başına maliyettir. Yazının çerçevesiyle söylemek gerekirse, böyle bir ucuz katman, otomatik bir yedek olarak değil, yenilmesi gereken yeni bir taban çizgisi olarak ele alınmalıdır.
- #zhipu-ai
- #llm-pricing
- #open-source
- #api
- #benchmarks
İlgili yazılar
- FineTune Studio, Qwen3-1.7B'yı yaklaşık 3,2 GB VRAM ile QLoRA üzerinden fine-tune ediyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- Apple Vision OCR yerel bir 27B VLM'den 300 kat hızlı çalışıyor ama tablo yapısını yok ediyor