· kaynak dev.to (home feed)
Kendini ClaudeBot olarak tanıtan bir crawler, bir sitenin .env dosyasını bir haftada 20 kez yokladı
Bir dev.to site işletmecisi, kendini ClaudeBot olarak tanıtan bir user agent'ten gelen 20 /.env isteği kaydetti; GreyNoise verileri, kimlik bilgisi dosyalarını hedefleyen daha geniş kapsamlı bir sahte AI crawler adı kampanyasına işaret ediyor.

Tanıdık bir ad, alışılmadık bir dosya istiyor
Küçük bir Japon sitesi, tek bir hafta içinde /.env dosyasına yönelik yirmi istek aldı; hepsi Anthropic'in web crawler'ı olan ClaudeBot olarak kendini tanıtan bir user agent'ten geldi. dev.to'da yazan işletmeci, genellikle veritabanı şifreleri, API anahtarları ve bulut kimlik bilgilerini içeren bu dosyanın doğru şekilde 404 döndürdüğünü, ancak istek deseninin aksi halde sıradan olan crawler trafiğinin arasında dikkati çektiğini belirtiyor.
18 Eylül'de sona eren yedi günlük site panosu, normalin neye benzediğini gösteriyor: Bytespider'dan 27 ana sayfa isteği, meta-externalagent tarafından getirilen etiket sayfaları, ChatGPT-User tarafından okunan bir cep wifi yazısı. İki kayıt buna uymuyordu. /.env yolu ClaudeBot'a atfedilen 20 istek çekti ve var olmayan bir /read-document yolu PerplexityBot'tan 6 istek çekti. Bu yolların hiçbiri sitede mevcut değil.
Pano bariz soruyu yanıtlayamadı
Bu yirmi isteğin gerçekten Anthropic'ten gelip gelmediği asıl önemli soru ve yazarın kendi araçları bunu çözemez. Pano, ClaudeBot'u hafta için %68 "doğrulanmış" olarak işaretledi — yani isteklerinin kabaca üçte biri Anthropic'e ait olarak doğrulanamamıştı — ancak doğrulama path başına değil, crawler başına hesaplanıyor. /.env isteklerinin doğrulanmış mı yoksa doğrulanmamış paya mı düştüğünü söylemenin bir yolu yok. Veriler, yazarın geliştirdiği bir WordPress eklentisi olan AILYS Lens'ten geliyor ve yazar ayrıca AILYS Doctor adlı ilgili bir teşhis servisini de beyan ediyor.
Gönderi atıf konusunda dikkatli: loglardaki hiçbir şey, adı şirketin bilgisi dışında kullanılan Anthropic hakkında bir iddia olarak okunmamalı.
GreyNoise daha geniş bir sahtecilik kampanyasını belgeledi
Bağlam, güvenlik firması GreyNoise'dan geliyor; firma 31 Ağustos'ta 28 Temmuz ile 23 Ağustos arasını kapsayan gözlemlerini yayımladı: AI crawler adlarını taklit eden taramalar yapan 824 IP adresi. Dört AI şirketine ait altı crawler adı taklit edildi, iki Amazon crawler adı daha büyük hacimde göründü ve istenen yollar /.env, /.env.production, /.env.bak ve /.aws/credentials idi.
Dev.to yazarının vurguladığı ipucu: Kampanya boyunca sıfır robots.txt isteği. Gerçek ClaudeBot robots.txt'yi sürekli getirir — yazar bunu trafiğinin kabaca %12'si olarak tahmin ediyor — oysa sahtekarlar bunu bir kez bile getirmedi. Yapılandırma dosyalarının peşinde ama kural dosyasını hiç kontrol etmeyen bir istemci, header'ı ne derse desin bir kimlik bilgisi tarayıcısı gibi davranıyor.
User agent bir iddiadır, kimlik değil
Crawler adlarının seçimi kasıtlıydı, diye savunuyor yazar. Site sahipleri son iki yıldır GPTBot, ClaudeBot ve PerplexityBot gibi adlara dayanarak izin ver ya da engelle kararları vermeleri söylendi; dolayısıyla firewall'lar ve eklentiler artık bu dizeleri karar girdisi olarak ele alıyor. Bir user agent header'ı, istemci tarafından kendisi hakkında yazılır ve yazar bu noktayı iki hafta önce kendi sitesinde gösterdi: sahte bir ClaudeBot header'ıyla tek bir curl isteği, panoda ClaudeBot olarak kaydedildi. Herkesin yazabileceği bir dizeye bağlı bir kural, bir kontrol gibi gösterilmiş bir uzlaşmadan ibarettir.
İşletmeciler ne yapabilir
Gönderinin önem sırasına göre önerileri:
- Asla gizli bilgileri HTTP üzerinden sunmayın. .env erişilemezse, tarama boşa harcanmış bir 404'ten ibarettir.
- Adlara değil, adreslere bakın. OpenAI, Anthropic, Perplexity, Common Crawl ve Google'ın hepsi IP aralıkları veya reverse-DNS şemaları yayımlar; bunlardan biri olduğunu iddia eden ama eşleşmeyen bir istek, kanıt olarak değersizdir.
- Eksik olana dikkat edin. robots.txt'yi hiç getirmediği halde yapılandırma yollarını isteyen bir istemcinin ucuz ve bariz bir imzası vardır.
- Crawler trafiğini ayrı, iyi niyetli varsayılan bir kategori olarak değil, sıradan trafik olarak ele alın.
Yazar ayrıca verilerin sınırlarına işaret ediyor: bir sitede yirmi istek küçük bir örneklemdir, GreyNoise kampanyasıyla tutarlıdır ama onun kanıtı değildir ve istekleri uygulamaya ulaşmadan yanıtlayan sayfa cache'leri, her sayımın bir alt sınır olduğu anlamına gelir.
Neden önemli
İki eğilim burada kesişiyor. İşletmeciler AI crawler erişimini giderek user-agent adına göre yönetiyor ve tarayıcılar artık ifşa olmuş kimlik bilgilerini yoklamak için bilinçli olarak bu adları taklit ediyor. Olayın kendisi küçük, ama GreyNoise'un 824 adreslik kampanyası bu tekniğin ölçekte aktif olarak kullanıldığını gösteriyor. Pratik çıkarım yapısal: user-agent izin listeleri uzlaşmalardır, kontroller değil ve gerçekten işe yarayan savunma — gizli bilgileri HTTP yüzeyinden tamamen uzak tutmak — uygulanması hiçbir şeye mal olmaz.
- #web-security
- #ai-crawlers
- #user-agents
- #env-files