· kaynak dev.to (home feed)
ClaudeBot taklidi tek bir curl komutu gerektirdi ve crawler panası buna inandı
Bir dev.to deneyi, yapay zeka crawler analitiğinin tek satırlık bir curl ile sahte üretilebildiğini gösteriyor: sahte istekler ClaudeBot eğitim trafiği olarak sayıldı ve çoğu sağlayıcının crawler'ı hiçbir şekilde doğrulanamıyor.

Tek satırlık curl, üç ClaudeBot isteğine dönüştü
dev.to'da paylaşım yapan bir geliştirici, yapay zeka crawler analitiğinin ne kadar kolay manipüle edilebildiğini ortaya koydu. Yazar, Anthropic'in kendi dokümantasyonundan alınmış bir user agent dizisi ve tek bir curl komutu kullanarak, Japonya'daki bir dizüstü bilgisayardan, sıradan ev interneti üzerinden kendi sitesindeki bir makaleye üç istek gönderdi. Sitenin crawler panası bunun üzerine Anthropic ClaudeBot eğitim sayacını 1.698'den 1.701'e yükseltti ve son görülme zaman damgasını 09:22 olarak güncelledi.
Bu üç isteğin hiçbiri Anthropic kaynaklı değildi. Kaynak adres hiçbir crawler listesinde yer almıyor. Yazarın deyimiyle araç tam olarak tasarlandığı gibi çalışıyordu: gelenleri ve her isteğin kendini ne olarak tanıttığını kaydediyordu. User agent dizisi bir öz beyandır ve herkes yazabilir.
Doğrulama boşluğu
Sorunu nicelendirmek için yazar, davaonline.net üzerinde 4 Eylül 2026'da sona eren otuz günlük trafiği inceledi: 13.491 crawler isteğinin 10.390'ı gerçekten yazı içeren sayfalara düşmüştü. Bunların yalnızca yaklaşık 2.200'ü — kabaca altıda biri — sağlayıcıların kendilerinin yayımladığı IP aralıklarıyla doğrulanabildi. Geri kalan her şey, isteğin bildirdiği bir dizenin sözüne güvenilerek kayda geçti.
dev.to gönderisine göre, doğrulanamayan çoğunluk üç ayrı başarısızlığa ayrılıyor:
- 6.947 istek (%51) hiçbir doğrulama yöntemi yayımlamayan sağlayıcılardan geldi.
- 2.226 istek (%16) yalnızca yazarın elindeki paket halindeki sağlayıcı aralıkları kopyasının eskimesi nedeniyle doğrulanamadı.
- 4.318 istek (%32) yazarın elindeki bir listeyle kontrol edildi ve adresler eşleşmedi.
Hiçbir şey yayımlamayan sağlayıcılar
Meta, ByteDance ve Amazon, sitede gözlemlenen crawler'lar için makine tarafından okunabilir IP aralıkları ya da ters-DNS şeması yayımlamıyor; bu da doğrulamayı zor değil imkânsız kılıyor. Örneklemedeki en büyük tek crawler olan ve 5.728 istekle temsil edilen meta-externalagent bu grupta yer alıyor. Amazon, Amazonbot için bir liste yayımlamaya yakın görünüyor; ancak adresler yalnızca JavaScript çalıştıktan sonra ortaya çıkıyor, dolayısıyla otomatik araçlar bunu kullanamıyor. ByteDance ise kendine özgü bir tuzak kuruyor: bariz bir aday URL'si HTTP 200 döndürüyor ama gövde bir 404 sayfası; bu da durum kodlarını kontrol eden herkesi yanıltıyor.
Eskimiş anlık görüntüler
İkinci başarısızlık yazarın kendi araçlarına aitti. Anthropic 18 Ağustos'ta bir IP aralık listesi yayımlamaya başladı ve Common Crawl 11 Ağustos'ta aynı şeyi yaptı; ikisi de analitik eklentisiyle gelen 20 Temmuz tarihli anlık görüntüden sonraydı. Araç eski dünyayı rapor etmeye devam etti ve 2.226 isteği yalnızca doğrulanmamışken doğrulanamaz olarak sınıflandırdı. 4 Eylül'deki bir düzeltme doğrulanabilir crawler sayısını on birden on beşe çıkardı ve ayrıca, aralıkları hiç paketlenmemiş olmasına rağmen aylardır doğrulanabilir olarak listelenmiş bir Google crawler'ını ortaya çıkardı. dev.to'da çıkarılan ders şu: doğrulanabilirlik bir crawler'ın özelliği değil, başka birinin listesinin elinizdeki kopyasının ne kadar güncel olduğunun özelliğidir.
Perplexity için sıfır eşleşme
Üçüncü başarısızlık görmezden gelinmesi en zor olanı. Perplexity IP aralıkları yayımlıyor ve yazarın elinde bunlar vardı. Yine de otuz günde Perplexity-User (984) veya PerplexityBot (103) kimliğiyle gelen 1.087 isteğin tek biri bile Perplexity'nin kendi listesindeki bir adresten gelmedi. OpenAI listesini güncel tutuyor — ChatGPT-User aralıkları 14 Ağustos'ta yenilendi — ancak bu kimliği talep eden 887 isteğin yalnızca %6'sı eşleşti. Kıyas için: Applebot %98, GPTBot %81 ve GoogleOther %100 doğrulandı.
Gönderi, hiçbiri elenemeyen dört açıklama öne sürüyor: istekler, site sahiplerine izin vermesi söylenen isimlerden yararlanan taraflarca sahteleniyor; yayımlanan listeler eksik — Perplexity'nin user-fetch listesi on bir aydır el değmeden dört aralıkta duruyor; meşru istekler yayımlanan altyapı dışından çalışıyor olabilir; ya da yazarın saatlik doğrulama işi bunları hiç işlememiştir, çünkü sınırlı gruplar halinde çalışıyor ve bir günden eski kayıtları atıyor. Pano "kontrol edildi ve başarısız oldu" ile "hiç kontrol edilmedi" arasında ayrım yapamıyor; yazarın kabul ettiği bir eksiklik bu.
Sayılar hâlâ neyi gösteriyor
Doğrulanmış sayılar gerçek crawler etkinliği için bir alt sınır oluşturur, asla üst sınır değil; çünkü her başarısızlık biçimi gerçek ziyaretleri doğrulanmamış kayıtlara dönüştürür. Doğrulanmamış bir toplam kötü niyet anlamına gelmez; çünkü bunun büyük kısmı hiçbir şey yayımlamayan sağlayıcıları yansıtır. Boşluk sağlayıcı başına en anlamlıdır: aralık yayımladığı hâlde kendi adına geçen trafiğin hiçbiriyle eşleşmeyen bir şirket bir şey söylüyordur; hiçbir şey yayımlamayan bir şirket ise yalnızca bunu söylüyordur.
Neden önemli
Yapay zeka erişimini engelleme, izin verme, lisanslama ve ölçümleme kararlarının tamamı crawler kimliğine dayanır; hangi şirketin neyin üzerinde eğitim yaptığı yönündeki kamusal iddialar da öyle. Bir kimlik tek satırlık bir curl ile sahtelenebiliyorsa ve büyük sağlayıcıların çoğu bunu kontrol etmenin bir yolunu sunmuyorsa, yayımlanan crawler istatistikleri — eğitim trafiğinin belirli şirketlere atfedilmesi dahil — yüzeydeki değeriyle kabul edilemez. IP doğrulamalı sayılar standart uyguluma haline gelene kadar, ham user-agent sayılarına dayanan her argüman, öz beyana dayanan bir argümandır.
- #ai-crawlers
- #web-scraping
- #user-agent
- #analytics
- #anthropic
İlgili yazılar
- GPT-6 Astra robot kollarını yönetiyor: blok alma-bırakmada 19/20, hassas yerleştirmede ise takılıp kalıyor
- OpenAI, hızlanan model yarışında Claude Fable 5.1'in ardından günler sonra GPT-6 Astra'yı duyurdu
- Anthropic, kodlama agent'ları için 200K context üzerinde extended thinking sunan Claude Sonnet 4.5'i yayınladı