· kaynak Hacker News – Front Page (native)
SynthID-Text ile Claude'a eklenen filigran ajan tool call'larını ölçülebilir biçimde değiştiriyor
Lasso Security, Anthropic'nin Claude'a eklediği SynthID-Text filigranının örnekleme yapılan token'ları tool call'ları ve reddetmeleri değiştirecek kadar etkilediğini — bu etkiye sampling drift adını veriyor.

Anthropic, filigranlı Claude çıktılarını API'ye getiriyor
Anthropic, gelecekteki Claude modellerinin çıktılarına görünmez bir filigran gömeceğini duyurdu; dağıtım üzerine yaptığı analizle yakın zamanda Hacker News'in ana sayfasına ulaşan Lasso Security'ye göre ise Anthropic daha sonra bu tekniğin Google DeepMind'ın SynthID-Text'i olduğunu doğruladı. Anthropic filigranı model düzeyinde uyguladığı için, bu hem Claude Platform API üzerinden sunulan destekli modelleri hem de bulut sağlayıcıları üzerinden sunulanları kapsıyor. Claude'u bir ajanın akıl yürütme bileşeni olarak kullanan bir geliştirici, ajan ayrı bir uygulama olsa bile filigranlı üretimleri devralır.
Lasso Security'nin sorusu, bu filigranın açılmasının yalnızca kaynak sinyaline değil, modelin davranışına ne yaptığıdır.
Örneklemeyi değiştiren bir kaynak doğrulama mekanizması
Metin filigranları, çıktıyı makine üretimi olarak işaretlemek için tasarlanır. SynthID-Text gibi üretim sırasında uygulanan yaklaşımlar, bitmiş metni sonradan işlemek yerine her bir sonraki token'ın nasıl seçildiğini değiştirerek çalışır — bu durumda tournament sampling yoluyla. Lasso Security, filigranın rastgeleliği üzerinden beklenti içinde orijinal token dağılımını koruyan distortionary olmayan yapılandırmayı kullandı ve Dathathri vd.'nin yaklaşık yirmi milyon Gemini yanıtında ölçülebilir bir kalite düşüşü bulmadığını not etti.
Sorun şu ki distortionary olmayan, aynı olduğu anlamına gelmiyor. Garanti filigranın rastgeleliği boyunca geçerlidir; belirli bir anahtar üretim sırasında token seçimini değiştirir ve etkinin büyüklüğü modele ve anahtara göre değişir. Lasso Security ortaya çıkan davranışsal değişime sampling drift adını veriyor.
Bahislere ilişkin riskler sohbette değil, ajanların içinde daha yüksektir. JSON gibi yapılandırılmış çıktıda süslü parantezler, anahtarlar ve fonksiyon adları genellikle öngörülebilirken; değerler — sorgular, sayılar, dosya yolları, alıcılar — öngörülebilir değildir ve tournament sampling'in token seçimini değiştirmek için en çok alan bulduğu yer tam da orasıdır. Düz yazıda üslup farklılığı olarak okunan bir varyasyon, ajanın sonra çalıştırdığı farklı bir argümana dönüşebilir.
Dağıtımın ardındaki düzenleyici baskı
Dağıtım tamamen bir ürün kararı değil. AB AI Act'in 50(2). maddesi, sentetik metin üreten yapay zeka sistemlerinin sağlayıcılarının çıktıları makine tarafından okunabilir bir biçimde işaretlemesini ve teknik olarak uygulanabilir olduğu ölçüde etkili, birlikte çalışabilir, sağlam ve güvenilir teknik çözümlerle yapay olarak üretildiklerinin tespit edilebilmesini gerektiriyor. Filigran bunun bariz adayıdır; bu yüzden davranış üzerindeki yan etkileri artık AB içinde veya AB'ye yönelik ajan gönderen herkes için önemli.
Etki nasıl ölçüldü
Lasso Security eşleştirilmiş bir tasarım yürüttü: her prompt aynı seed, batch bileşimi ve sırayla SynthID'li ve SynthID'siz üretildi; tek fark filigran işlemcisiydi. Tool calling, 0.001, 0.7 ve 1.0 sıcaklıklarında BFCL v4 tek tur AST görevlerinde değerlendirildi. Reddetme davranışı, 200 HarmBench zararlı davranış artı 100 zararsız JailbreakBench kontrolü üzerinde 0.001 ve 0.7'de test edildi; zararlı istekler hem çıplak hem de tek bir sabit prompt injection tekniği altında sunuldu. Uygulama, HuggingFace'in değiştirilmemiş SynthIDTextWatermarkLogitsProcessor'ıydı; 30 tournament katmanı, 5 n-gram uzunluğu, 2^16 girişli bir örnekleme tablosu ve 1.024'lük bir bağlam geçmişiyle yapılandırıldı ve tek bir anahtar yerine birden fazla filigran anahtarı test edildi.
Dalgalanma, ana rakamlardan daha büyük
Tool call beklenen öğelerde filigran, test edilen yedi modelden altısında doğruluğu düşürdü; dördünde anlamlı ölçüde. Ancak net doğruluk, tek tek prompt'lara ne olduğunu gizler: hatalı hale gelen bir call, doğru hale gelen bir başkasıyla telafi edilebilir ve toplam neredeyse değişmeden kalır.
Bu yüzden Lasso Security ayrıca dalgalanmayı — filigranlı ve filigransız çalıştırmalar arasında kararı farklılaşan öğelerin payını — ölçtü. BFCL'in sabit 1.150 üyelik canlı olmayan call-beklenen görev setinde dalgalanma, net doğruluk değişiminden önemli ölçüde büyüktü. 1.0 sıcaklıkta phi-4'ün call kararlarının yüzde 16,8'i değişirken net doğruluk kaybı yalnızca 2,87 puan oldu; Llama-3.1-8B'de kararların yüzde 9,9'u değişirken net kayıp 0,87 puandı. 21 model-sıcaklık kombinasyonu genelinde dalgalanma ortalama yüzde 6,5 oldu ve bootstrap aralığı her durumda sıfırı dışladı. Çalışma, drift'in yalnızca tool calling'de değil, reddetme davranışında da ortaya çıktığını raporluyor; ancak yayımlanan rakamlar tool calling sonuçlarına odaklanıyor.
Prompt injection bu iki senaryoyu birbirine bağlıyor. Bir modelin zararlı bir isteği reddedip reddetmediği — ve bu reddin injection altında direnip diremediği — filigranın yanlılık yüklediği aynı örneklenen token'lar tarafından belirlenir ve zayıflayan bir ret, model araçlar üzerinden harekete de geçebildiğinde daha sonuç doğurucu hale gelir.
Neden önemli
Anthropic'nin bu adımı, kaynak doğrulama uyumluluğunun üretimde model davranışını yeniden şekillandırmek üzere olduğunu gösteriyor. Düzenleyici tespit edilebilirlik için getirilen bir filigran, ajanların hangi araçları hangi argümanlarla çağırdığını değiştiriyor; doğru araca yapılan ama yanlış yol, alıcı veya tutar içeren iyi biçimlendirilmiş bir call, yanlış şeyi yaparken başarıyla çalışabilir. Toplu benchmark'lar neredeyse sıfır etki okunurken, prompt'ların yaklaşık on beşte biri filigran altında farklı davranıyor. Filigranlı API'ler üzerinde ajan inşa eden ekipler, hiçbir şeyin değişmediğine güvenmeden önce Lasso Security'nin tanımladığı eşleştirilmiş, öğe bazlı karşılaştırmayı yeniden üretmeli; filigran tasarımcıları da injection altındaki ret sağlamlığını değerlendirmenin bir son düşünce değil, bir parçası olarak ele almalı.
- #ai-agents
- #watermarking
- #anthropic
- #eu-ai-act
- #llms
İlgili yazılar
- Kayıtlar, Meta'nın Muse uygulamasının bazı oturumları bir OpenAI modeline yönlendirdiğini gösteriyor
- Opus 5.5 ve GPT-6 güncellemeleri 90 dakika arayla geldi, ilgiyi ise Meta'nın Muse'u topladı
- Ortaya çıkan kimlik bilgileri yüzde 81 artışla 1,27 milyona ulaştı; GitGuardian triage için AI ajanları ekledi