· kaynak dev.to (home feed)
Denetim, WAF engelleri ve RAG chunking'in çoğu kurumsal siteyi ChatGPT ve Perplexity'ye görünmez kıldığını iddia ediyor
KusiAI tarafından dev.to'da yayımlanan adli bir denetim, test edilen 50'den fazla kurumsal sitenin yüzde 90'ından fazlasının AI tarayıcılarına görünmez olduğunu bildiriyor; bunun nedeni olarak içerik kalitesi değil, WAF 403 yanıtları ve RAG chunking gösteriliyor.

Barselona merkezli bir araştırma laboratuvarı olan KusiAI'nin dev.to'da yayımladığı bir mühendislik denetimi, incelediği kurumsal web sitelerinin yüzde 90'dan fazlasının ChatGPT Search ve Perplexity gibi üretken yanıt motorlarına fiilen görünmez olduğunu bildiriyor. Ekip, elli aşkın kurumsal platformu inceledikten sonra başarısızlığın editoryal değil, altyapısal olduğu sonucuna vardı: üst üste duran üç katmanlı bir yapı, retrieval-augmented generation (RAG) boru hatlarının bir sitenin içeriğini hiç içine almasını engelliyor. Yüzde 90 rakamı tek bir satıcının örnekleminden geldiği için yöneltici bir bulgu olarak okunmalı, ancak anlattığı hata biçimlerinin her biri her web operatörü tarafından denetlenebilir.
Katman bir: AI tarayıcılarına 403 ile yanıt veren güvenlik duvarı
Denetime göre yanıt motorları artık yalnızca statik indekslere bağlı değil. Sorgu anında ChatGPT Search ve Perplexity gibi sistemler, tanımlanabilir user agent'larla aday URL'lerde canlı getirmeler yapıyor: OpenAI için GPTBot ve OAI-SearchBot, Anthropic için ClaudeBot, PerplexityBot ve ByteDance'in Bytespider'ı. Gönderiye göre çoğu kurumsal site, Cloudflare, AWS WAF veya Sucuri gibi web application firewall'ların arkasında duruyor ve varsayılan olarak etkinleştirilmiş genel anti-scraper kuralları ya da Bot Fight Mode gibi özellikler bulunuyor. Bu kurallar tarayıcıya bir HTTP 403 ya da etkileşimli bir CAPTCHA challenge'ı ile karşılık veriyor. Bot JavaScript challenge'ını çözemediği için URL'yi 200 milisaniyenin altında terk ediyor ve kullanıcıya yanıt veren model, sunucusu normal yanıt vermiş bir rakibe geçiyor. Yazarlar ilk tanı aracı olarak kısa bir Python betiği yayımlıyor: betik hedef bir URL'yi her tarayıcının user-agent dizesiyle istiyor ve çevrenin 200 mü yoksa bir engelleme mi döndürdüğünü raporluyor.
Katman iki: chunking, içine alınanların ne kadar hayatta kalacağına karar veriyor
Güvenlik duvarını geçen içerik daha sonra bir vektör içine alma boru hattına giriyor ve denetime göre geleneksel SEO metni tam da burada başarısız oluyor. Yoğun embedding modelleri metni kabaca 256 ila 512 tokenlık sabit chunk'lara bölüyor; bu yüzden şişirilmiş girişlerle yazılmış 2.000 kelimelik tek parça bir makale, ürettiği her chunk'ın vektör yoğunluğunu seyreltiyor. Yazarlar ayrıca belgelenmiş "lost in the middle" dikkat etkisine dikkat çekiyor; transformer'lar bir chunk'ın başını ve sonunu en ağır biçimde ağırlıklandırdığından, chunk'ın ortasında kalan olgular cross-encoder reranking sırasında elenme eğiliminde. E1b kuralı olarak adlandırdıkları çare yapısaldır: her semantik başlığın hemen ardından, içinde bir iddia, doğrulanabilir bir rakam ve doğrudan teknik bir sonuç bulunan, 40 ila 68 kelimelik kapalı bildirimsel bir blok gelmeli; 20 kelimenin altındaki yetim paragraflar bulunmamalı. Kabaca 70 kelimenin altında tutulduğunda, geri alınan her parça, tokenization nereden keserse kessin eksiksiz bir yanıt taşır.
Katman üç: modeller için agent-native bir yüzey
Yazım tarzının ötesinde denetim, seviye-5 agent-native mimari dediği yapıyı öngörüyor: statik olarak üretilmiş, insana dönük bir site — gönderi örnek olarak Astro'yu veriyor — 50 milisaniyenin altında time-to-first-byte hedefiyle, ayrıca domain kökünde makine tarafından okunabilir manifest'lar. Bunlar arasında işletmeyi ve uç noktalarını tanımlayan bir /llms.txt indeksi, modeller için atıf talimatları içeren /agents.md ve Model Context Protocol üzerinden araçları açığa çıkaran /.well-known/mcp. yer alıyor. Yazarlar ayrıca pasif sitemap'leri her derlemden sonraki beş saniye içinde gönderilen IndexNow bildirimleriyle değiştirmeyi ve şirket varlıklarını Wikidata ve ORCID gibi kararlı tanımlayıcılara bağlayan derin JSON-LD işaretlemesini öneriyor. KusiAI, metodolojinin açık bir araştırma deposunda (Zenodo) ön kayıtlı olduğunu, böylece sonuçların yeniden üretilebileceğini belirtiyor.
Neden önemli
Bu bulgunun哪怕 bir bölümü bile doğruysa, AI aracılı aramadaki görünürlük anahtar kelimelerle değil, güvenlik duvarı yapılandırması ve içerik yapısıyla belirleniyor demektir. ChatGPT veya Perplexity tarafından atıf almak isteyen operatörler hemen harekete geçebilir: çevreyi AI tarayıcı user agent'larıyla yoklayabilir, siteyi okumasını istedikleri botlara allowlist uygulayabilir ve herhangi bir 512 tokenlık pencerenin eksiksiz, kendi başına yeterli bir ifade içerdiği şekilde temel sayfaları yeniden yapılandırabilir. İki uyarı önemsenmeyi hak ediyor. Birincisi, rakamlar tek bir laboratuvarın elli kadar sitelik örnekleminden ve bu sınıfta denetim satan bir satıcıdan geliyor; yüzde 90'ı sektör geneli bir oran olarak görmek için bağımsız doğrulama gerekli. İkincisi, denetim görünürlüğün amaç olduğunu varsayıyor; içerikleri, lisansları veya altyapıyı korumak için AI tarayıcılarını bilinçli olarak engelleyen operatörler ters bir ödünleşim yapıyor ve GPTBot'a verilen bir 403 bir arıza değil, politika olabilir.
- #ai-crawlers
- #rag
- #waf
- #seo
- #generative-search