· kaynak dev.to (home feed)
330 LLM'in Korece değerlendirmesi cevapların üçte birini yalnızca yazı sistemi kontrolüyle otomatik eliyor
330 modelin Korece değerlendirmesinde cevapların %33'ü, Hangul yetersizliği veya yazı sistemi kirliliği nedeniyle otomatik olarak başarısız sayıldı; modellerin %52'si en az bir kez hata yaptı, 54 model ise tüm görevlerde kaldı.

Dört satırlık bir yazı sistemi kontrolü, 330 dil modelinin yapıldığı yeni Korece değerlendirmenin en aydınlatıcı bölümü olduğunu kanıtladı: juri tek bir cevabı okumadan önce, külliyatın üçte birini düzgün Korece yazılmadığı gerekçesiyle diskalifiye etti.
Değerlendirme, ginigen-ai leaderboard ekibinden geliyor; yöntem dev.to'da yayımlanan bir yazıda anlatıldı ve metodoloji Hugging Face üzerinde barındırılıyor. Modeller yedi eksende puanlandı — hitap dili (honorifics), terminoloji, Kore kurumları bilgisi, özetleme, doğallık, üslup ve format uyumu — ancak ilk filtre tamamen mekanikti.
Juri önünde dört satırlık bir kapı
Kontrol karakterleri sayar. Bir cevap, %25'ten azı Hangul ise, üçten fazla Hanja (Korecenin yalnızca seyrek kullandığı Çin karakterleri) içeriyorsa ya da herhangi bir Japonca kana içeriyorsa başarısız olur.
Bu ölçüte göre 2.304 cevabın 766'sı — %33,2 — otomatik olarak elendi. 330 modelin 171'i (%51,8) en az bir kirlenmiş cevap üretti ve 54 model (%16,4) yedi görevin tamamında yazı sistemi kontrolünde kaldı: yedi prompt boyunca geçen tek bir cevap bile üretmediler.
Yazıya göre gerekçe şu: Kısmen Çince bir cevabı puanlaması istenen bir LLM juri, yine de ton ya da üslup hakkında makul görünen bir puan döndürür — cevap istenen dilde olmamasına rağmen veriye benzeyen bir sayı. Bu yüzden ekip bir çizgi çekti: bir cevabın doğru yazı sisteminde olup olmadığı sayılabilir, ton sayılamaz ve bir cevap juriye ancak sayımdan geçtikten sonra ulaşır. 766 juri çağrısının tasarruf edilmesi bir yan etkiydi, amaç değil; bunu da not düşüyorlar.
Başarısızlıklar en zor dilbilimsel görevlerde kümeleniyor
Otomatik elemeler eşit dağılmadı: 142 model hitap dilinde, 125'i terminolojide, 113'ü Kore kurumlarında, 105'i özetlemede, 99'u doğallıkta, 93'ü üslupta ve 89'u format uyumunda kaldı. Bir modelden dilbilimsel olarak en çok şey isteyen görev, cevapların en sık yazı sisteminden çıktığı yer de oldu.
Her şey ölçülmeden önce juri kalibre ediliyor
Puanlandırmadan önce harness, bilinen beklenen puanlara sahip sabit bir kontrol cevabı seti çalıştırır ve her birini doğru puanlamadığı takdirde çalışmayı iptal eder. Juri ayrıca model adlarını hiç görmez — bu, öz-tercihi (self-preference) elemek için — ve rubrik, jürilerin gevezeliği ödüllendirmeye eğilimli olduğu için uzunluğun ilgisiz olduğunu belirtir.
Notlar ve üretici ortalamaları
Sekiz bant genelinde not dağılımı: A+++ (5 model), A++ (2), A+ (18), B+ (55), B (58), C (52), D (29) ve F (111). Modellerin yalnızca %7,6'sı herhangi bir A bandına ulaştı; %33,6'sı F aldı.
Eksen bazındaki A oranları: hitap dili %8,5 ve Kore kurumları bilgisi %9,4 iken; terminoloji %31,2, format uyumu %47,6, özet doğruluğu %49,2, çeviri dili olmama (translationese'sizlik) %53,1 ve üslup %53,3. İki eksen alanın kabaca onda birinde dururken geri kalanlar yarım civarında kümeleniyor.
En az sekiz modeli ölçülmüş üreticiler için 0–3 ölçeğinde üretici ortalama puanları: anthropic 2,29 (14 model), mistralai 2,07 (18), openai 1,96 (51), qwen 1,48 (51), google 1,48 (27), deepseek 1,33 (15), meta-llama 1,16 (8), nvidia 0,93 (10), minimax 0,70 (8) ve z-ai 0,36 (15). Yazarlar sınırlar hakkında açık — tek prompt seti, tek juri, tek koşu — ve tabloyu üreticiler hakkında bir hüküm değil, bu belirli ölçümün bir anlık görüntüsü olarak çerçeveliyor.
Güncellik ve boyut hiçbir şey öngörmüyor
Beş model tam 3,00 puan aldı: openai/gpt-5.4, openai/gpt-5.4-mini, openai/gpt-4o-2024-05-13, openai/gpt-3.5-turbo-16k — 2023 tarihli bir model — ve google/gemini-3.1-flash-image. Hitap dilinde A kazanan 28 model arasında gpt-4o-mini, qwen-2.5-72b-instruct ve llama-3.1-70b-instruct gibi orta ölçekli modeller de vardı.
Koreceye yönelik bir ürün için model seçen herkes için çıkarım: çıkış tarihi, parametre sayısı ve İngilizce leaderboard'lardaki konum burada hiçbir sinyal taşımıyordu.
Neden önemli
Çok dilli yetkinlik genellikle İngilizce benchmark'lardan varsayılır ve bu ölçüm, bu varsayımın ölçekte başarısız olduğunu gösteriyor — alanın yarısından fazlası art arda yedi cevabı doğru yazı sisteminde tutamadı. Herhangi bir dilde değerlendirme yapan herkes için taşınabilir ders, sayılabilir kontrolü önce yazmak ve juri görmeden cevapları reddetmesini sağlamak: juri yanlış yazı sistemindeki bir cevabı puanlar ve o puan, sonuçlarınızdaki meşru puanlardan ayırt edilemez olur. Leaderboard'un kendisi kamuya açık — 426 model takip ediliyor, 330 model puanlanmış, her gün yenileniyor — ve cevap bazında gerekçe dizileri döndüren açık bir API'ye sahip, böylece spesifik notlar yalnızca ortalamalar değil, tek tek itiraz edilebiliyor.
- #llm
- #evaluation
- #multilingual
- #korean
- #benchmarks