· kaynak dev.to (home feed)
weightwatch v0.1, yüklenmeden önce açık ağırlıklı modelleri arka kapı tetikleyicileri için tarıyor
AGPL lisanslı yeni bir CLI aracı, üçüncü taraf ince ayarlı LLM'ler üzerinde black-box tarama yapıyor; gizli arka kapı tetikleyicilerini ortaya çıkarıp checkpoint yüklenmeden önce CLEAN, SUSPICIOUS veya BACKDOOR kararları veriyor.

Araç ne yapıyor
Bir geliştirici, üçüncü taraf açık ağırlıklı modelleri herkes yüklemeden ve güvenmeden önce arka kapılar açısından kontrol etmek için geliştirilmiş weightwatch v0.1 adlı bir komut satırı tarayıcısı yayınladı. Pedro Sordo Martínez'in dev.to'daki duyuru yazısına göre araç black-box şekilde çalışıyor: ne modelin eğitim verisine ne de bilinen temiz bir referans checkpoint'e ihtiyaç duyuyor. Bunun yerine uyuyan bir arka kapıyı tetiklemeye çalışıyor ve üç karardan birini — CLEAN, SUSPICIOUS veya BACKDOOR — CI pipeline'larının üzerinde işlem yapabileceği sıfırdan farklı bir çıkış koduyla bildiriyor.\n Yazının çerçevesiyle ortaya koyduğu asıl sorun şu: herkes Hugging Face gibi bir hub'da ince ayarlı bir LLM yayınlayıp bunun güvenli olduğunu beyan edebilir. Arka kapılı bir model normal kullanımda düzgün davranır ve yalnızca gizli bir tetikleyici ortaya çıktığında kötü davranmaya başlar; dolayısıyla standart değerlendirme bunu asla ortaya çıkarmayabilir.
Kendi tarafından raporlanan bir araç eksikliği
Yazar, araştırma ile uygulama arasındaki bu uyuşmazlığı 2026 tarihli arXiv makalelerini GitHub repository sayılarıyla karşılaştırarak ölçtüğünü söylüyor. Açık ağırlıklı modellerdeki arka kapılar için 75 makale saymış, ancak fiilen hiç araç yok: "fine-tuned model backdoor scanner" için sıfır, "fine-tuning poisoning detector" için bir repository. Buna karşılık multi-agent güvenlik ve halüsinasyon tespiti gibi yakın alanlarda halihazırda yüzlerden binlere ulaşan repo var. Bu rakamlar yazarın kendi sayımıdır ve bağımsız olarak doğrulanmamıştır, ama gerçek bir dengesizliği tasvir ediyorlar: araştırma mevcut, pratik denetim araçları ise neredeyse yok.
Tarama nasıl çalışıyor
Yazıya göre weightwatch iki tekniği birleştiriyor:
- Çıktıdan girdiye döngüsü: model metin üretiyor ve kendi çıktısı sabit bir seed'de birkaç greedy iterasyon boyunca girdi olarak geri besleniyor. Tarayıcı, yörüngenin kararlı bir anormal imzaya — gizli bir arka kapının parmak izine — yakınsayıp yakınsamadığını kontrol ediyor. Yazı, temeldeki tekniği arXiv:2608.11348'e atfediyor.
- Canary probları: tipik arka kapıların tetiklendiği zararsız girdilerden oluşan bir küme. Tarayıcı, kaç canary'nin beklenen imzayı ürettiğini sayıyor; eğitim verisi veya temiz bir taban modeli gerektirmeden.
Yazıdaki örnek CLI çalıştırması, paketle birlikte gelen arka kapılı fixture için JSON çıktısını gösteriyor: BACKDOOR kararı, yüksek şiddet seviyesi, döngünün 1.0 puanla bir işaretçi dizesine yakınsaması, beş canary'nin tamamının tetiklenmesi ve 1 çıkış kodu.
v0.1'in dürüst sınırları
Özellikle yazar, bu sürümün gerçek dünyada tespitten çok tarayıcının mantığını doğruladığını açıkça belirtiyor. Sürüm 0.1, gerçek transformer checkpoint'leri yerine gömülü sentetik fixture'lar (bir CleanLM ve bir BackdooredLM) üzerinde çalışıyor; hızlı test paketi ise ağ erişimi veya API anahtarı olmadan çevrimdışı yürütülüyor. Gerçek Hugging Face modellerinde arka kapıları doğrulama işi, v0.2 için planlanan yavaş pakete bırakılmış. Verdikar ayrıca iki tekniği birleştiren bir buluşsal yöntem, matematiksel bir kanıt değil: yazı, doğrusal olmayan arka kapıların yalnızca SUSPICIOUS puan alabileceği konusunda uyarıyor ve Sleeper Agents çalışması tarzında white-box probing (arXiv:2608.24037 olarak atıf yapılmış) v0.3 için planlanıyor. Bu uyarılar repository'nin KNOWN_ISSUES.md dosyasında belgelenmiş, gömülmüş değil.
Yazı ayrıca mühendislik rakamlarını da raporluyor: her iki fixture'ı, determinizmi ve temiz fixture'ta yanlış pozitifleri elemek için on farklı seed'i kapsayan 15 geçen pytest testi; temiz ruff lint çıktısı; toplamda %88 kapsam; lint ve hızlı testleri çalıştıran bir GitHub Actions pipeline'ı; ve AGPL-3.0-or-later lisansı. Bir __init__.py dosyasında eksik olan lisans başlığı, temiz klon denetimi sırasında yakalanmış ve yayından önce düzeltilmiş.
Neden önemli
Herkese açık hub'lardan ince ayarlı checkpoint'leri çekmek artık rutin bir uygulama ve yazarın atıf yaptığı makaleler (arXiv:2608.11348 ve arXiv:2608.11295), eğitim verisi veya temiz bir referansı olmayan bir kullanıcının uyuyan bir arka kapıyı ancak tetikleyicisi ateşlenmedikçe görünmez kaldığı için tespit edemeyeceğini savunuyor. weightwatch'un temel fikri — tetikleyiciyi beklemek yerine onu zorlamak — gerçek bir model tedarik zinciri riskine karşı makul bir ilk savunma hattı. Uyarı da en az bunun kadar önemli: planlanan v0.2 paketi gerçek checkpoint'larda tespiti gösterene kadar v0.1, kanıtlanmış bir tarayıcıdan çok doğrulanmış bir çerçeve. Yazar, bunu daha önceki keybound ve topowatch projelerinin yanında model tedarik zinciri denetim araçları hattının ilk girdisi olarak konumlandırıyor ve üçüncü taraf modelleri yükleyen herkesin güvenmeden önce taraması gerektiğini öneriyor.
- #ai-security
- #llm
- #open-source
- #supply-chain
- #model-safety
İlgili yazılar
- FineTune Studio, Qwen3-1.7B'yı yaklaşık 3,2 GB VRAM ile QLoRA üzerinden fine-tune ediyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- BrowserSkill, yapay zeka ajanlarınıza zaten oturum açtığınız tarayıcıyı kullanma imkanı veriyor