· kaynak dev.to (home feed)
Claude'un yapay zekâ metin filigranı nasıl çalışır: turnuva örneklemesi, tespit ve sınırlar
dev.to'daki bir inceleme, Anthropic'in Claude filigranının anahtarla tohumlanmış turnuva örneklemesini token seçimlerini nasıl yanlı yönlendirdiğini, dedektörlerin prompt olmadan metni nasıl puanladığını ve ağır düzenlemenin sinyali nasıl silebildiğini açıklıyor.

İşaret token seçimlerinde gizli
Filigranlanmış bir dil modeli imzasını gizli metadata'da değil, seçtiği kelimelerde bırakır. dev.to'daki bir açıklamaya göre ortaya çıkan metin normal okunuyor ve işaret token dizisinin kendisi tarafından taşıdığı için düz metin editörüne kopyalanmaya dayanıyor. Eşleşen gizli anahtara sahip bir dedektör bu örüntüyü daha sonra test edebilir.
İncelemenin vesilesi Anthropic'in Ağustos 2026 tarihli "Claude'un metin filigranı nasıl çalışır" yazısı. dev.to yazısına göre Claude, Google DeepMind'ın 2024'te Nature'da yayımladığı SynthID-Text şemasının bir sürümünü kullanıyor ve Anthropic, AB Yapay Zekâ Yasası'nın şeffaflık gereksinimlerini karşılamak için filigranlamayı hayata geçirdiğini söylüyor.
Tek tek kelimeler halinde
Bir dil modeli bir seferde bir token yazar — bir kelime, kelimenin bir parçası veya noktalama — ve olası her sonraki tokena olasılık atar; örneğin GPT-2'nin tokenizer'ı kabaca 50.000 token içerir. Filigranlanmamış örnekleme bu olasılıkları doğrudan izler. Filigranlama modelin ağırlıklarını değiştirmez, yalnızca hangi adayın seçildiğini etkiler.
Yazar tek bir kararı takip ediyor: "The cat" ifadesinden sonra yalnızca "sits" (%50), "sat" (%30) ve "lies" (%20) sıfırdan farklı olasılığa sahip olsun — örneklendirme için uydurulmuş sayılar. Filigransız model "The cat sits on the mat" yazabilir; filigranlıysa "The cat sat on the rug" üretebilir.
Turnuva örneklemesi
SynthID-Text bir sonraki tokenı turnuva örneklemesiyle seçer. Önce modelin olasılıklarına göre birkaç aday çekilir — örnekte dört aday çekiliyor ve "sits, sat, sits, lies" elde ediliyor. Gizli anahtar ve önceki tokenlarla tohumlanmış bir algoritma daha sonra her adaya 0 veya 1 panı verir. Adaylar eleme turlarında karşılaşır; her maçta yüksek puan kazanır, eşitlikler rastgele bozulur ve aynı tokenın puanı turlar arasında farklılık gösterebilse de aynı tokenın kopyaları bir tur içinde aynı puanı paylaşır.
İşlenmiş örnekte "sits", en yüksek model olasılığına sahip olmasına rağmen iki maçını da kaybediyor ve turnuvayı "sat" kazanıyor. Kritik özellik tekrarlanabilirlik: aynı anahtar, ayarlar ve token bağlamı her zaman aynı puanları üretir, bu da daha sonra tespiti mümkün kılar. Tek bir seçim pek bir şey kanıtlamaz, çünkü filigransız bir model de aynı kelimeyi seçebilir; ancak çok sayıda token boyunca filigranlı metin, yalnızca şansın açıklayabileceğinden daha yüksek puanlar taşımaya eğilimlidir.
Kalite sorusu
Adayları modelin olasılıklarından çekmek, olası devam niteliklerini iyi temsil etmeyi sağlar, ama bu tek başına iyi yazı garanti etmez. SynthID-Text, kaliteyi koruyan bir yapılandırma ve kaliteden ödün vererek daha güçlü bir filigran üreten başka bir yapılandırmayla geliyor. dev.to makalesine göre Google, kaliteyi koruyan yapılandırmayı yaklaşık 20 milyon Gemini yanıtında test etti ve makale, filigransız çıktıya kıyasla başparmak yukarı/aşağı derecelendirmelerinde istatistiksel olarak anlamlı bir fark bildiriyor. Ayrıca tespit, modelin bir sonraki token konusunda gerçek bir seçeneğinin olmadığı yerlerde en zordur, çünkü işaret bırakmak için daha az alan vardır — doğruluğun belirli bir ifadeyi zorunlu kıldığı pasajlarda pratik bir sınırdır bu.
Prompt olmadan tespit
Dedektör, metne, gizli anahtara, üretim sırasında kullanılan aynı filigran ayarlarına ve eşleşen tokenizer'a ihtiyaç duyar. Önceki tokenlar pasajda zaten mevcut olduğu için, her tokenın filigran puanlarını yalnızca bağlamdan yeniden hesaplayabilir; dört tokenlık bir bağlamda ilk dört tokenı basitçe atlar. Temel bir dedektör kurtarılan puanların ortalamasını alır ve tekrarlanan bağlamları atlar, böylece tekrarlanan bir ifade yeni kanıt olarak sayılmaz.
Filigransız metnin ortalaması yaklaşık 0.5 civarında olmalıdır, çünkü puanlama fonksiyonları kabaca eşit sayıda sıfır ve bir atar; filigranlı metinse daha yüksek eğilim gösterir. Bu ortalamalık tek başına kanıt değildir: kısa pasajlar şansla yüksek puan alabilir, bu yüzden eşikler filigransız metne göre kalibre edilir ve uzunluğu hesaba katmak zorundadır. Düzenleme sinyali aşındırır — beş tokenlık bir pencerede bir tokenı değiştirmek o konumdaki ve sonraki dört konumdaki puan girdilerini değiştirir ve bütün bir kelimeyi değiştirmek, tokenizasyona bağlı olarak daha fazla tokenı etkileyebilir. Küçük düzenlemeler işaretin büyük kısmını bozulmadan bırakır; kapsamlı yeniden yazım onu tespit edilemez hale getirebilir.
Milyarlık bir eleme tablosundan kaçınmak
30 tur derinliğinde bir turnuva, token başına bir milyardan fazla aday gerektireceğinden, yazarın Google Colab'da GPT-2 ile test ettiği küçük uygulama, eşdeğer kazanma olasılıklarını doğrudan hesaplar. Her tur, olasılık dağılımını 1 puan alan tokenları tercih edecek şekilde ayarlar; ağırlık, zaten ne kadar olasılığa sahip olduklarına göre belirlenir. Kedi örneğinde "sat", birinci turdan sonra %30'dan %45'e, ikinci turdan sonra %69,75'e yükselir — kaynak, bu rakamın en az bir finalistin o token olma şansını yansıttığını söylüyor.
Neden önemli
Anthropic'in filigranlamayı AB Yapay Zekâ Yasası'na bağlaması, provenance sinyallerinin yaygın kullanılan asistanlarda varsayılan olarak gelebileceğini, platformlara ve düzenleyicilere şeffaflık yükümlülükleri için teknik bir kanca sunabileceğini gösteriyor. Ancak mekanizmalar gerçekçi beklentiler belirliyor. Tespit anahtarla sınırlı, yani herkesin çalıştırabileceği kamusal bir adli araç değil; kararlar istatistikseldir ve kısa, yoğun şekilde düzenlenmiş veya az seçenekli metinlerde zayıflar; Google'ın ölçekte test ettiği kaliteyi koruyan yapılandırma ise muhtemelen kullanıma sunulacak olan. Bu dedektörlere bel bağlayan herkesin — yayıncılar, eğitimciler, moderasyon ekipleri — hem yanlış pozitif kalibrasyonunu hem de yeniden yazımın kanıtı ne kadar kolay sildiğini anlaması gerekiyor.
- #watermarking
- #anthropic
- #machine-learning
- #synthid
- #eu-ai-act