deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

4.900 LLM oturumunu kapsayan test, yazım hatalarının zararsız ama eksik tırnak işaretinin prompt'u bozduğunu gösteriyor

dev.to'da yayımlanan ve yaklaşık 4.900 model oturumunu kapsayan bir deney, frontier LLM'lerin yoğun yazım hatalarından etkilenmediğini, tek bir eksik tırnak işaretinin veya silinen iki noktanın ise doğruluğu ölçülebilir biçimde düşürdüğünü ortaya koydu.

4.900 LLM oturumunu kapsayan test, yazım hatalarının zararsız ama eksik tırnak işaretinin prompt'u bozduğunu gösteriyor

Vadim Albarov'un dev.to'da yayımladığı kontrollü bir deney, prompt'larının yazımını cilalayan herkesin yanlış şeyi düzelttiği sonucuna varıyor. Yaklaşık 4.900 model oturumunda frontier LLM'ler temiz metinle, kelimelerinin %70'i hatalı yazılmış prompt'lar arasında neredeyse aynı puanı aldı — tek bir yanlış noktalama işareti ise aynı modellere 8 ile 23 puan arası kaybettirdi.

Ne test edildi

Yazar iki prompt seti hazırladı. Kolay set, kısa ve doğrulanabilir cevaplı 12 tek satırlık görevden oluşuyordu; her biri temizden ağır şekilde bozulmuşa beş hata düzeyinde yazılmıştı. Zor sette ise cevabın gömülü bir ayrıntıya bağlı olduğu 200 ila 450 kelimelik dokuz prompt vardı ve zararın iki türü birbirinden ayrılıyordu. Yazım gürültüsü: bir betik kelimelerin %35 veya %70'ini, cevabın dayandığı kelimelere hiç dokunmadan yanlış yazıyordu. Yapısal kırılmalar: yazım kusursuz kalıyor ama tam olarak anlam taşıyan bir işaret yanlış oluyordu — eksik kapanış tırnağı, listeden önce silinen iki nokta ya da "9:45" yerine yazılan "9.45".

Bunların üzerine iki gerçekçi profil eklendi: ana dili Türkçe olmayan grameri ve noktalama, büyük harf içermeyen, sayıların yazıyla verildiği simüle edilmiş sesli dikte. Model kadrosu düşük ve orta efor düzeylerinde Claude Opus 5, Opus 5.5, Sonnet 5, Haiku 4.5 ve Fable 5.1'i, ayrıca Ollama üzerinden sunulan yedi yerel modeli kapsıyordu.

Yazım bedavaydı, yapı değildi

Zor sette frontier modeller %70 yazım hatası altında temiz metin puanlarına neredeyse ulaştı — Opus 5.5 yalnızca bir puan düştü — ve ana dili Türkçe olmayan gramer profilinde hepsi 100 puan aldı. "3dolar" ve "2notbook" gibi parçalara indirilmiş bir alışveriş listesi aritmetiği prompt'u hâlâ doğru cevaplar döndürdü. Ama kusursuz yazımla gelen tek bir yapısal kırılma her frontier modele zarar verdi: Opus 5 ve Haiku 100'den 88'e, Sonnet 100'den 77'ye düştü.

Küçük yerel modeller hem daha düşük taban puanlara hem de daha sert düşüşlere sahipti. Mistral 7B temiz prompt'larda 52 alırken yoğun yazım hatası altında 26'ya indi; bu da yazara göre, frontier modellerin küçük modellerin kaldıramadığı yazım gürültüsünü emdiğini doğruluyor.

Hangi kırılmalar önemliydi

Noktalama hatalarının çoğu bağlamdan kurtarıldı. Avrupatarzı ondalık ayırıcılar, "9.45" olarak yazılmış bir saat, "managers" içinde kaydırılmış bir kesme işareti ve belirsiz bir bilet filtreleme talimatında silinen virgül, test edilen her Claude modeli tarafından sorunsuz çözüldü.

İki kırılma çözülemedi. Eksik kapanış tırnağı en kötüsüydü: tırnak içine alınmış bir paragrafta bir kelimenin geçiş sayısını sayması istenen her model, paragraftan sonraki metindeki üç fazladan geçişi de sayıp 5 yerine 8 cevabını verdi. Gönderiye göre Opus 5.5, kapanış tırnağının eksik olduğunu açıkça belirtti ve yine de her şeyi saydı — kırılmayı teşhis etti ama yine de ona itaat etti. Beş frontier model o görevde 0 ile 33 arasında puan aldı.

Silinen iki nokta ise talimat ile veri arasındaki sınırı bozdu. Listenin nerede başladığını işaretleyen iki nokta olmadan, bir kelime listesinin çoğul biçimlerini isteyen prompt'ta "reply" kelimesi pluralize edilmesi gereken bir kelime daha gibi okundu. Sonnet ve tüm yerel modeller oltaya geldi.

Dikte bambaşka bir sorun

Simüle edilmiş sesli dikte profili, küçük modellerin çöktüğü yerdi. gemma4 78'den 44'e, granite 4.2 93'ten 56'ya düştü ve her yerel model dikte edilen bir liste görevinde sıfır aldı; buna yazıyla verilmiş sayılarla eksik liste iki noktasının birleşimi sebep oldu.

Frontier modeller büyük ölçüde başa çıktı, dürüst istisnalarla: Sonnet altı denemenin altısında "two fifty"yi 250 dolar olarak okudu ve 3.750 yerine 375.000 cevabını verdi. Yazarın belirttiği gibi, konuşma diliyle söylenen sayılar gerçekten belirsizdir; dolayısıyla model tahmin etmek zorundadır.

İşe yaramayanlar

Eforu düşükten ortaya çıkarmak hiçbir görevde değişiklik yaratmadı; yazar bunun nedenini yapısal kırılmaların akıl yürütme sorunu olmamasına bağlıyor — daha fazla düşünme, kaybolan bir sınırlayıcıyı geri getirmez. Mesajın hata içerebileceğine dair önden eklenen uyarının beş frontier modelden üçü üzerinde etkisi sıfırdı, yerel modellerde ise karışık ya da olumsuz etkiler görüldü.

Biçim de doğruluktan önce bozuldu. Yoğun gürültü altında Haiku istenmemiş açıklamalara kaydı ve en yüksek hata düzeyinde, temiz gramerle aynı soruyu sorunsuz cevaplamışken, saçma kelimeli bir mantık sorusunu sekiz denemeden dört kez reddetti.

Neden önemli

LLM özellikleri geliştirenler için ders şu: prompt hijyenini yazım düzeltme değil, ayrıştırma (parsing) olarak görmeye başlayın. Yazım ve gramer göz ardı edilebilir; ama talimatları veriden ayıran sınırlayıcılar — kapanış tırnakları, listelerden önceki iki noktalar, "except" ve "not" çevresindeki virgüller — edilemez. Bu, diktenin noktalamayı silip sayıları belirsizleştirdiği transkripsiyon boru hatları için, ayrıca verinin temiz sınırlayıcılara ihtiyaç duyarak ayakta kalabildiğini gösterdiği 7B ila 14B yerel model kullanan dağıtımlar için iki kat geçerli.

Uyarılar gerçek: her hücrede üç deneme, gerçek konuşma motoru çıktısı yerine elle simüle edilmiş dikte ve minimal bir system prompt. Ama test düzeneği, prompt'lar ve ham yanıtlar açıkça yayımlandı; ekipler, şabonlarında hangi karakterlerin gerçekten ağırlık taşıdığına karar vermeden önce testi kendi görevlerinde yeniden koşabilir.

  • #llm
  • #prompt-engineering
  • #ai
  • #ollama
  • #benchmarking

İlgili yazılar