deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Z.AI'nin GLM-6.0 yol haritası, ön eğitim, orta eğitim ve eğitim sonrasını kapsayan bir öz-eğitim döngüsüne odaklanıyor

Z.AI, GLM-6.0 adını açıkladı ve ön eğitim, orta eğitim ile eğitim sonrasını kapsayan Tam Öz-Eğitim'i (Full Self-Training) öncelikli hedefi haline getirdi; ancak henüz bir model kartı, benchmark sonucu, API veya sürüm tarihi bulunmuyor.

Z.AI'nin GLM-6.0 yol haritası, ön eğitim, orta eğitim ve eğitim sonrasını kapsayan bir öz-eğitim döngüsüne odaklanıyor

Z.AI, GLM-6.0 adını açıkladı ve Tam Öz-Eğitim'e güveniyor

Z.AI, GLM-6.0'ı kamuya açık biçimde adlandırdı ve şirketin açıklamasına dayanan bir dev.to analizine göre Tam Öz-Eğitim'i (Full Self-Training) geliştirme yol haritasının merkezine yerleştirdi. Hedeflenen döngü eğitim yaşam döngüsünün tamamını — ön eğitim, orta eğitim ve eğitim sonrasını — kapsıyor; öz-üretilmiş deneyim, değerlendirme, düzeltme ve veri filtreleme, sonraki eğitim turlarına geri besleniyor.

Açıklama bir ürün lansmanı değil, stratejik bir yön. Dev.to analizinin vurguladığı gibi, GLM-6.0 için eksiksiz bir kamuya açık model kartı, benchmark seti, API spesifikasyonu, fiyatlandırma veya sürüm tarihi bulunmuyor. Mevcut olan, bir modelin kendi bir sonraki eğitim döngüsünü üretmek için gereken işin daha fazlasına katılması tarifinin ta kendisi. Analizde aktarıldığı üzere şirketin açıkladığı gelir kullanımı, net gelirin yaklaşık %60'ını yeni nesil modellere, Tam Öz-Eğitim'e, büyük ölçekli eğitime, çıkarıma (inference), hesaplama gücüne ve ilgili altyapıya yönlendiriyor.

Modelin etrine sarılı üç döngü

Analizde ortaya konduğu gibi Tam Öz-Eğitim kavramı üç bileşene dayanıyor.

İlk bileşen veri üretimi. Self-play, kural tabanlı kontroller, yürütme sonuçları, model yargılaması ve insan örnekleme denetimleri; model üretiminden görev yürütmeye, doğrulama ve filtrelemeden yeniden eğitime uzanan bir dizide bir araya geliyor. Zor olan kısım doğruluğu ve çeşitliliği korumak: kabul edilen örnekler tekrarlı, ince hatılı veya zayıf bir hakemi tatmin edecek şekilde optimize edilmişse ucuz üretim hiçbir şey katmıyor. Veri öz-arındırması ancak düzeltme sinyali, düzelttiği davranıştan daha güvenilirse bir değer taşıyor.

İkinci bileşen ortamın öz-inşası. Agent'lar gerçek dünya görevlerini toplayacak ya da dönüştürecek, bunları deneyecek, doğrulayıcılar inşa edecek ve bu görevleri eğitime kabul etmeden önce çözülebilirliklerini kontrol edecek. Bu, kodlama ve agent iş yükleri için en çok fark yaratan nokta; çünkü terminal durumu, araç çıktısı, tarayıcı durumu, test sonuçları ve başarısızlıktan kurtulma, makul görünen bir metin yanıtından daha güçlü denetim sağlıyor.

Üçüncü bileşen, modelin yardımıyla altyapı optimizasyonu: bir kodlama modeli operatörler, kernel'lar, zamanlama, önbellekleme veya serving koduna yönelik değişiklikler öneriyor ve dış doğrulama, gerçekten neyin kullanıma sunulacağına karar veriyor. Hedeflenen döngü bileşik biçimde büyüyor — daha iyi model, daha iyi sistem önerileri, doğrulanmış verimlilik kazanımları, daha fazla eğitim deneyi, daha iyi model — ve otomatik benchmark'lar, tekrarlanabilirlik ve insan incelemesi kontrol noktaları olarak işlev görüyor.

Bir adlandırma tuzağı ve mevcut referans noktası

Analiz bir kafa karışıklığı noktasına dikkat çekiyor: Ox Alpha, GLM-5.3-Flash'ın sürüm öncesi kimliğiydi ve sızan GLM-6.0 performansına dair bir kanıt değil.

Mevcut olan tek somut spesifikasyonlar mevcut nesle ait. Z.AI, GLM-5.3-Flash'ı toplam 320B ve aktif 18B parametreli bir mixture-of-experts model olarak, 30T token'lık çok modlu bir kümeyle eğitilmiş ve yayımlanmış bir model kimliği ile canlı bir API ile sunuluyor olarak tanımlıyor.

Bir verimlilik detayı tek bir sayıya indirgenmemeli. Z.AI'nin sürüm metni, GLM-5.3-Flash için GLM-5.3'e kıyasla yaklaşık 3.0 kat daha düşük attention hesaplaması ve 4.4 kat daha küçük KV-cache boyutu bildirirken, eşlik eden resmi grafik bir milyon token'lık karşılaştırmayı attention hesaplaması için 3.40x ve katman başına KV cache için 3.80x olarak etiketliyor. Dev.to analizi, bu farklılık gösteren resmi rakamları sessizce birleştirmek yerine bağlamlarıyla birlikte aktarmayı öneriyor.

Benchmark'lar bugünün modellerini ölçüyor, GLM-6.0'ı değil

Yayımlanan sonuçlar mevcut modellere ait resmi Z.AI değerlendirmeleri ve hiçbiri bir GLM-6.0 sonucu değil. GLM-5.3-Flash, raporlanan sette GLM-5.2'yi geride bırakıyor: Terminal Bench 2.1'de 84.3'e karşı 81.0, DeepSWE v1.1'de 63.4'e karşı 46.2, Toolathlon Verified'da 78.4'e karşı 59.9, AutomationBench v1.0.6'da 48.8'e karşı 26.2 ve GDPval-AA'da 1773'e karşı 1504 Elo. En büyük farklar otomasyon ve yazılım mühendisliği değerlendirmelerinde görülüyor — tam da bir eylemin başarılı olup olmadığının, sonucun başka bir mekanizmayla doğrulanıp doğrulanamayacağının ve agent'ın başarısızlıktan kurtulup kurtulamayacağının ölçülebilir olduğu alanlar. Bu, öz-eğitim yol haritasının hedeflediği bölge de tam olarak.

Neden önemli

Dev.to analizi belirleyici soruyu güzel ortaya koyuyor: Bir modelin daha fazla eğitim verisi üretip üretemeyeceği değil, çevresindeki sistemin hangi deneyimin eğitim verisi olmayı hak ettiğine ve ne zaman durulacağına güvenilir biçimde karar verip veremeyeceği. Yaşam döngüsünün tamamını kapsayan öz-eğitim sektörün işleyen modeli haline gelirse, rekabet avantajı veri hacminden doğrulayıcı kalitesine, bağımsız kontrollere ve durdurma ölçütlerine kayar. GLM-6.0'ın şu anda yayımlanmış bir yetenek profili yok; dolayısıyla buradaki hiçbir şey bir API geçişi planlamayı gerekli kılmıyor. Ama yol haritası, Z.AI'nin sınırları itici kazanımların nereden geleceğine inandığının net bir sinyali: modelin kendisinin etrine döngüyü kapatan yönetilen geri bildirim sistemleri.

  • #ai
  • #large-language-models
  • #training
  • #ai-agents
  • #z-ai

İlgili yazılar