· kaynak dev.to (home feed)
Cloudflare AI kayıtları, bir sitenin ChatGPT-User trafiğinin yarısının sır taradığını gösterdi
dev.to'da yayımlanan bir yazı, 859 isteğin 447'sinin ChatGPT-User etiketiyle /id_rsa ve /.env.prod.bak gibi dosyaları yokladığını ortaya koydu — ve Cloudflare'in ücretsiz planında AI agent'leri yalnızca user-agent dizgisinden tanımlanıyor.

Yanlış yönü işaret eden bir hata oranı
dev.to'da yazan bir geliştirici, yakın zamanda Cloudflare'ın AI Crawl Control özelliğini açtı; özellik sürekli olarak veri topluyordu. Ortaya çıkan ilk 24 saatlik pencerede AI agent'lere atfedilen 1.890 istek görüldü; bunların 483'ü başarısız oldu — önceki güne kıyasla hatalarda yüzde 63'lük bir artış. En yoğun girdi, OpenAI'ın belgelerinde birisi ChatGPT'ye veya bir Custom GPT'ye soru sorduğunda sayfayı getiren agent olarak tanımladığı ChatGPT-User'dı; bu agent, belirli bir programa göre tarama yapmıyor. 859 istek ona atfedildi ve bunların yalnızca 412'si 200 durumu döndürdü.
Gönderiye göre yazarın ilk açıklaması rahatlatıcı derecede sıradandı: dokümantasyon slug'ları birden fazla kez taşınmıştı, dolayısıyla hata veren eski URL'ler başarısızlıkları açıklardı ve bir yönlendirme haritası sorunu çözerdi. Ardından asıl başarısız yollar incelendi.
Başarısız yollar bir güvenlik açığı taramasına benziyordu
İstekler /id_rsa, /terraform.tfstate, /.env.prod.bak, /elmah.axd, /@fs/proc/self/environ, /.github/workflows/deploy.yml, /.claude/settings. ve /api/config gibi uç noktalara çarpıyordu. 483 başarısız isteğin 447'si bu desene uyuyordu ve her birinde ChatGPT-User user agent'i taşıyordu. Bunlar otomatik taramanın ders kitabı hedefleri: özel SSH anahtarları, sık sık kimlik bilgileri içeren Terraform state dosyaları, ortam yedekleri, CI pipeline yapılandırması ve bilgi sızdırdığı bilinen framework'e özgü yollar.
Her yoklama 404 döndürdü ve hiçbir şey açığa çıkmadı. Gönderinin belirttiği gibi, sıradan internet arka plan gürültüsü olarak herkese açık site saat başına bu tür trafik alır. Olayı dikkat çekici kılan, trafiğin geldiği kanal ve ona bağlı addı.
User-agent dizgileri köken kanıtı değildir
Yazarın ikinci düzeltmesi etiketin kendisiyle ilgili. Gönderide alıntılanan Cloudflare belgeleri, ücretsiz planda AI Crawl Control'ün AI crawler'ları user-agent dizgilerinden tanımladığını belirtiyor — ve bir user agent, istemcinin göndermeyi seçtiği sıradan bir dizgidir. Bu nedenle bulgunun savunulabilir versiyonu dardır: 859 istek ChatGPT-User adını talep etti, bunların 447'si sır yokladı ve 412'si 200 yanıtı aldı. Herhangi bir isteğin gerçekten OpenAI'dan gelip gelmediği, bir user-agent etiketinin yanıtlayamayacağı bir sorudur. Yazar ayrıca, 412 başarılı isteğin gerçek getirmeler olduğu yönündeki önceki taslak iddiayı da geri çekti; çünkü verilerde bunu destekleyen bir şey de yok.
Hangi doğrulama mümkün
Gönderi, kurumsal sözleşme olmadan doğrulanmış trafiği yalnızca talep edilen trafikten ayırmanın yollarını listeliyor:
- OpenAI, agent başına IP aralıkları yayımlıyor; ChatGPT-User için ayrı bir liste de dahil, dolayısıyla kayıtlı adresler bununla karşılaştırılabilir.
- Cloudflare, her planda WAF özel kurallarında
cf.client.botalanını sunar; ChatGPT-User user agent'iyle eşleşirkencf.client.bot'u hariç tutan bir kural, doğrulanmış botları taklitçilerden ayırır. - Daha güçlü olan verified-bot alanı ve tespit ID'leri, Bot Management ile birlikte Enterprise gerektiriyor; yazar bunun devrede olduğunu varsaymıştı ama öyle değildi.
Bir önbellek karmaşası
Gönderi bir düzeltme daha ekliyor: yazarın atıfta bulunduğu, bu ay yayımlanan bir araştırma, ChatGPT'nin açılan sayfaları hesaplar arasında paylaşılan ve URL'ye göre anahtarlanan bir önbellekten sunduğunu buldu. Bir hesabın kopyası, origin sunucusuna hiçbir istek ulaşmadan başka bir ülkedeki başka bir hesaba sunulabilir. Bu nedenle sunucu kayıtlarındaki bir ChatGPT-User isabeti, sıradaki soran kişi için bir yenilemedir; o anda soru soran kişi için canlı bir getirme olması gerekmez. Yazar, AI agent'ler için bir bellek motoru olan Mnemoverse'ü geliştirdiğini açıklıyor ve verinin kendi sitesinin trafiğini izlemekten geldiğini söylüyor.
Neden önemli
Bu, panoları eleştirel bir gözle okumakla ilgili derli toplu bir ders. Toplu bir metrik — başarısız AI isteklerinde yüzde 63 artış — bir site sağlığı sorunu gibi görünüyordu ve aslında otomatik tarama olan şeyi düzeltmek için neredeyse bir yönlendirme haritası oluşturulacaktı. Ayrıca AI crawler analitiğinin user-agent tanımlamasının zayıflıklarını miras aldığını gösteriyor: giriş seviyesi planlarda herhangi bir istemci tanınmış bir botun user agent'ini sunabilir, bu da AI trafik sayılarını şişirir ve hangi crawler'lara izin verileceğine veya hangilerinin engelleneceğine dair kararları potansiyel olarak çarpıtır. Çare gösterişsiz ama etkili: bir pano ne diyorsa ona göre hareket etmeden önce, talep edilen kimlikleri yayımlanmış IP aralıkları ve verified-bot sinyalleriyle çapraz kontrol edin.
- #cloudflare
- #web-security
- #ai-crawlers
- #bots
- #openai
İlgili yazılar
- OpenAI, agent sürüsünün Almanca wiki'yi ele geçirmesinin ardından yapay zeka olay bildirimi süreçlerini köklü şekilde değiştirecek
- OpenAI, 1,05 milyon token bağlam penceresine sahip GPT-6 Astra'yı yeni fiyatlandırma ve akıl yürütme kademeleriyle piyasaya sürdü
- GPT-6 Astra, CodeRabbit'ın erken incelemesinde dosyalar arası hataları %20'ye kadar daha fazla yakalıyor