· kaynak Hacker News – Front Page (native)
Prefill testi, diğer açık modeller direnirken Qwen 3.8'in GPT-5.5 Pro akıl yürütmesini izlediğini gösteriyor
Hacker News üzerinden paylaşılan bir deneyde, Qwen 3.8 A95B'ye GPT-5.5 Pro'nun akıl yürütmesinin %1'i verildiğinde, öğretmenle cevap örtüşmesi iki kattan fazla arttı; bu da açık modelin bir GPT'den distillenmiş olabileceğine işaret ediyor.

9 Eylül'de GitHub gist olarak wsxiaoys tarafından yayınlanan ve Hacker News ana sayfasına taşınan gayri resmi bir deney, Qwen3.8 A95B'ye o modelin akıl yürütmesinin küçük bir parçası verildiğinde cevaplarının keskin biçimde GPT-5.5 Pro'ya doğru kaydığını bildiriyor. Aynı kurulumda test edilen diğer üç açık model neredeyse tepki vermedi. Yazar bu farkı, Qwen'un GPT-5.5 Pro veya onunla yakın ilişkili bir GPT modelinin çıktılarıyla eğitilmiş olabileceğine dair bir ipucu olarak yorumluyor.
Prefill testi nasıl çalışıyor
Bu yazı, yazarın akıl yürütme prefill deneylerinin 1.1 sürümü; aynı tekniğe dair önceki yazıların devamı niteliğinde, bu kez öğretmen rolünde GPT-5.5 Pro var. Değerlendirme seti 45 problemden oluşuyor ve STEM, STEM dışı ile sentetik bulmacalar olarak eşit bölünmüş durumda. Her problem için hedef model iki tamamlama üretiyor: sıradan, prefill'siz bir cevap ve GPT-5.5 Pro'nun akıl yürütme izinin ilk %1'inin hedef modelin akıl yürütme kanalına yerleştirildiği bir cevap. Görünür cevap her zaman hedef modele kendi başına üretmesi için bırakılıyor.
Puanlama, öğretmenin görünür cevabının hedef modelin cevabının ilk 100 tokenında ne kadar göründüğünü ölçüyor; unigram, bigram ve trigram kaynak hatırlamasının ortalaması olarak hesaplanıyor. Öğretmenin akıl yürütmesi usulca içeri sokulduğunda örtüşmesi sıçrayan bir model, fiilen o öğretmenin sesinde sürdürmeyi bildiğini gösteriyor.
Sonuçlar
| Model | Prefill'siz | GPT-5.5 Pro prefill ile | Fark |
|---|---|---|---|
| DeepSeek V4 Flash | %27,30 | %26,13 | −1,17 pp |
| Inkling | %19,99 | %20,45 | +0,46 pp |
| Kimi K3 | %31,11 | %35,65 | +4,54 pp |
| Qwen3.8 A95B | %16,79 | %34,97 | +18,18 pp |
Qwen3.8 A95B, prefill altında öğretmenle örtüşmesini iki kattan fazla artırıyor. Etki STEM problemlerinde en büyük: örtüşme %19,26'dan %46,24'e (+26,99 puan) çıkarken, STEM dışı %20,62'den %33,42'ye (+12,80) ve bulmacalar %10,49'dan %25,23'e (+14,75) yükseliyor.
Diğer modellerle kontrast çarpıcı. Kimi K3, hem prefill'li hem prefill'siz hâlde GPT-5.5 Pro ile en yüksek örtüşmeye sahip (%31,11 ve %35,65), ancak prefill yalnızca 4,54 puan ekliyor. DeepSeek V4 Flash −1,17 puanla hafifçe ters yöne kayıyor ve Inkling +0,46 ile esasen düz seyrediyor.
Yazarın vardığı sonuç
Gist'e göre Qwen, deneyin önceki turunda Opus 4.8'e neredeyse hiç yaklaşmamıştı; buradaysa GPT-5.5 Pro'ya doğru 18,18 puan hareket ediyor; bu etki özel sentetik bulmacalarda da büyük. Yazar bu örüntünün, Qwen'un Opus'tan değil, GPT-5.5 Pro'dan ya da yakın ilişkili bir GPT modelinden öğrenmiş olabileceğine işaret ettiğini yazıyor.
Neden önemli
Ağırlıkları açık modeller sessizce sınır teşkil eden tescilli öğretmenlerden distilleniyorsa, bu her alanda sonuçlar doğuruyor. Açık ağırlıkları kaynak veya egemenlik gerekçeleriyle seçen kullanıcılar, aslında belirli bir ticari modelin tuhaflıklarını ve hata biçimlerini devralıyor olabilir. Modelleri istemsizce öğretmen olarak kullanılan laboratuvarlar ise hizmet şartları ve telafi edilmemiş değer aktarımı konusunda sorularla karşı karşıya kalıyor. Prefill tekniğinin kendisi ise ucuz bir adli araç: 45 problem ve token düzeyinde bir örtüşme metriğiyle, eğitim verisine hiç erişmeden bir soy hattı sinyali üretiyor.
Uyarılar gerçek. Yazar bulguyu kanıt değil öneri olarak çerçevelendiriyor, n-gram örtüşmesi kaba bir vekil ve 45 problemlik set küçük. Ancak üç modelin prefille kabaca ilgilenmezken birinin güçlü tepki vermesi, tam da daha büyük ölçekte tekrarlanmayı davet eden türde bir sonuç; ve açık model ekosisteminin ne kadarının distillenmiş sınır modeli çıktısı üzerinde yüzdüğüne dair daha geniş bir tartışmanın ortasına düşüyor.
- #qwen
- #open-weights
- #distillation
- #reasoning-models
- #ai-safety
İlgili yazılar
- Rapor: Anthropic, AI aktivistlerini izlemek için öngörücü gözetim sistemi kuruyor
- Anthropic araştırmacısı istifa etti: Kendini geliştiren AI yarışının güvenliği geride bıraktığı uyarısını yaptı
- Anthropic güvenlik lideri, yapay zekanın insanlığı öldürme olasılığını yüzde 10'un üzerinde görüyor; bir meslektaşı istifa ediyor