deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Bir dolarlık deney: Bir prompt talimatının dört kez tekrarlanması LLM uyumunu artırıyor

Gemini 2.5 Flash üzerinde yapılan yaklaşık bir dolarlık bir deney, bir kuralın system prompt içinde tekrarlanmasının uyumu %74'ten %97'ye çıkardığını, dört tekrarın ötesinde ölçülebilir bir kazanç olmadığını gösterdi.

Bir dolarlık deney: Bir prompt talimatının dört kez tekrarlanması LLM uyumunu artırıyor

Yaklaşık bir dolarlık bir hafta sonu deneyi, prompt mühendisliğine dair bilinen bir rivalete somut sayılar kazandırdı: Bir talimatın system prompt içinde tekrarlanması, modelin ona ne kadar uyduğunu gerçekten iyileştiriyor, ancak fayda yaklaşık dört tekrarda sona eriyor. Sonuçlar, 19 Ağustos 2026'da yayımlanan ve Hacker News ana sayfasında öne çıkan "Say It Four Times (In Your System Prompt)" başlıklı bir khola.blog yazısından geliyor.

Test nasıl çalıştı

Yazar, modelin ya uyacağı ya da görmezden geleceği tek bir kural seçti — Python string'lerini çift tırnak değil, tek tırnakla yaz — ve aralıkları birleştirme ya da bir sözlüğü düzleştirme gibi altı sıradan fonksiyon istedi. Denemeler arasında tek değişken, kuralın system prompt içinde kaç kez geçtiğiydi: sıfır, bir, iki, dört, sekiz ya da on altı.

Her kombinasyon otuz kez çalıştırıldı, toplam 1,080 üretim, tümü thinking modu kapalı olarak Vertex üzerinden Gemini 2.5 Flash'ta yapıldı. Puanlama yargı gerektirmiyordu: Python'un kendi tokenizer'ı çift tırnakla açılan string'leri saydı.

Kural seçiminin kendisi ayrı bir dersti. Önceki üç aday — yorum yok, docstring yok, type hint yok — ilk bahsedilişte zaten yaklaşık %99 uyuluyordu, bu yüzden tekrarın bir etkı göstermesine yer yoktu. Tırnak stilinin seçilmesinin nedeni tam olarak modelin ona direniyor olmasıydı.

Sayılar

Kontrol her şeyi sabitliyor: Talimat hiç yokken, model kullanılabilir 171 sıfır-tekrar üretiminin tümünde çift tırnak kullandı. Kuralın bir kez söylenmesi uyumu %74'e çıkardı. Dört tekrar bunu %97'ye taşıdı. Ötesinde eğri düzleşti; sekiz ve on altı tekrar dört ile aynı aralıkta kaldı — yazar, bu örneklem büyüklüğünde küçük bir düşüşün fark edilmeyebileceğini de not ediyor.

Ortalamalar görev bazındaki geniş uçurumları da gizledi. Altı görevden ikisi ilk bahsedilişte tam uyuma ulaştı ve orada kaldı; aralık birleştirme görevi ise tek bahsedilişte yalnızca %20 başardı ve %97'ye ulaşmak için dört tekrar gerekti. Yazarın yorumuna göre tekrar, modeli geniş anlamda daha itaatkâr yapmıyor; yerleşik bir alışkanlığın talimatla çatıştığı belirli noktaları kurtarıyor.

Önceki araştırmayla tesadüfi bir örtüşme

Deney, Han-yu Wang'ın arXiv makalesi "When More Becomes Less: Position-Dependent Repetition Effects in Language Models" ile tetiklendi; makale, yan yana yerleştirilen tekrar kopyalarının yükselip sonra plato çizdiğini, modelin okuma yaptığı yerden uzaklara yayılan kopyaların ise erken bir zirveye ulaşıp sonra düştüğünü bildiriyor.

Yazar deneyin bu tümseği göstereceğini tahmin etmişti ve yanılmıştı. Her kopya tek bir blokta olduğundan, kurulum bitişik duruma karşılık geliyordu — yükselip düzleşmesinin öngörüldüğü durum. Sonuç bu yüzden beklenmedik bir yönden makalenin öngörüsüyle örtüştü; token düzeyindeki denemeler yerine bir kod modelinde doğal dil kuralı kullanıldı.

Gürültü ve inatçı kalıntılar

Görev ve tekrar kombinasyonlarının yarısı ile üçte ikisi arasında, otuz özdeş denemede karışık sonuçlar verdi: aynı prompt, aynı model, aynı ayarlar, farklı yanıtlar. Yazarın çıkardığı sonuç şudur: Bir prompt değişikliğini önce bir, sonra bir denemeyle değerlendirmek neredeyse anlamsızdır — üç deneme taban, on deneme daha iyidir.

Hayatta kalan ihlallerin bir biçimi vardı. Kural en az bir kez geçtiğinde, sıradan çift tırnaklı string'ler tamamen kayboldu; geriye kalan üç tırnaklı docstring'ler oldu. Model docstring'leri string değil belge olarak görüyor gibi görünüyor, dolayısıyla tırnaklama konusunda bir kural onlara hiç ulaşmıyor.

Pratik öneriler

Prompt kütüphanelerini yöneten ekipler için yazı, birebir tekrarı yaklaşık dörtte sınırlamayı ve artan bağlamı örneklere harcamayı öneriyor. Bireyler için inatçı bir kuralı dört kez tekrarlamak mevcut en ucuz çözüm olarak tanımlanıyor — ancak dört işe yaramıyorsa, ek kopyalar hiçbir şey kazandırmıyor, dolayısıyla yaklaşım değişmeli. Bir kısıtlama her yerde uyulup tek bir konumda uyulmuyorsa, docstring örneğindeki gibi, modelin farklı biçimde sınıflandırdığı bir şey arayın.

Uyarılar ve bir ölçüm tuzağı

Yazar kapsam konusunda açık sözlü: tek kişi, thinking kapalı tek model, tek bir blokta birebir tekrarlanan tek bir sözdizimi kuralı ve gerçek bir depo ya da agent döngüsü yerine altı bağımsız fonksiyon. Kopyaları prompt boyunca yaymak — makalenin sonunda zarar vereceğini öngördüğü yapı — hâlâ test edilmiş değil.

İlk gerçek deneme deneyi neredeyse batırdı. Gemini'nin thinking token'ları çıktı limitinden düşülüyor ama ayrı bildiriliyordu, bu yüzden kod üretimin ortasında sessizce kesildi ve kesilme bazı koşulları diğerlerinden daha sert vurdu. Yazar bunu fark etmeden önce ana uyum figürü %39 okunuyordu; düzeltmeden sonra %88. Üretimin neden durduğunu kaydetmeyen bir değerlendirme kurulumu, kendinden emin bir yanlış yanıt geri verebilir.

Neden önemli

Prompt mühendisliği önerileri yaygın biçimde dolaşıyor ama neredeyse hiçbir zaman ölçümlerle birlikte değil. Bu deney, en yaygın uygulamalardan birine sayılar bağlıyor ve rivalete bir tavanla birlikte kısmen hak veriyor. Metodoloji dersi en az kadar önemli olabilir: Mevcut gürültü düzeylerinde tek denemelik prompt değerlendirmesi güvenilmezdir ve üretimin neden bittiğini yok sayan test düzenekleri sonuçları görünmez biçimde çarpıtabilir. Yazar, çalıştırmadan önce kaydedilen tahmini, kod ve veriyle birlikte, başkalarının doğrulayabilmesi için yayımladı.

  • #prompt-engineering
  • #llms
  • #gemini
  • #evaluation
  • #system-prompts

İlgili yazılar