deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Meta botları bir sitenin AI crawler trafiğinin yüzde 52'sini aldı, hiçbiri kullanıcı kaynaklı değildi

Küçük bir WordPress sitesinde otuz günlük ölçüm, tüm AI crawler isteklerinin yüzde 52,3'ünü Meta'ya yerleştiriyor; canlı bir kullanıcı tarafından tetiklenen fetch sayısı ise sıfır.

Meta botları bir sitenin AI crawler trafiğinin yüzde 52'sini aldı, hiçbiri kullanıcı kaynaklı değildi

Küçük bir WordPress sitesini izlemeye başlayan bir geliştirici, Meta'nın crawler'larının otuz günlük dönemde tüm AI bot trafiğinin yarısından fazlasını oluşturduğunu — ve bu isteklerden hiçbirinin bir kişinin bir AI asistanına soru sormasından kaynaklanmadığını bildiriyor.

Rakamlar, yazarın aylarca AI crawler isteklerini kaydedip amaçlarına göre sınıflandırdığı dev.to üzerindeki bir yazıda yer alıyor. 11 Eylül'de sona eren otuz günde site 11.818 crawler ziyareti kaydetti; bunların 8.979'u yazılı içerik barındıran sayfalara denk geldi.

Tek bir sağlayıcı, trafiğin yarısından fazlası

Meta, izlenen tüm AI crawler isteklerinin yüzde 52,3'ünü aldı — diğer tüm sağlayıcıların toplamından (yüzde 47,7) daha büyük bir pay. Apple yüzde 12,0 ile onu izledi, ardından Anthropic yüzde 9,6, Perplexity yüzde 8,3, OpenAI yüzde 7,9 ve ByteDance yüzde 5,8 geldi. Common Crawl, Amazon ve Google ise kuyruğu sırasıyla yüzde 2,1, 1,5 ve 0,5 ile doldurdu.

Yazara göre pay sütunu tek başına, bu etkinliğin bir siteye fayda sağlayıp sağlayamayacağını belirlemiyor. Bunu belirleyen amaç sütunu.

Meta'nın üç AI crawler'ı ve her birinin yaptığı iş

Meta, AI'ye yönelik üç crawler belgeliyor. meta-externalagent, temel modelleri eğitmek ve ürünler için içerik indekslemek amacıyla materyal toplar. meta-webindexer, Meta AI arama kalitesini — doğru alıntılardan sorumlu bileşeni — iyileştirmek için gezinir. meta-externalfetcher ise bir kullanıcı bir bağlantı istediğinde tekil bağlantıları çeker — yani saniyeler önce canlı bir kişinin o sayfayı istediğine dair sinyal.

Otuz gün boyunca dağılım dengesizdi: eğitim crawler'ından 6.027 istek, alıntı kalitesi crawler'ından 155 istek ve kullanıcı kaynaklı fetch'ten sıfır istek geldi. Bu, cevap kalitesine yönelik her istek için kabaca otuz dokuz eğitim isteği demek; insan kaynaklı bir fetch'in görüneceği satır ise boş.

Beş başka sağlayıcı — OpenAI, Perplexity, Anthropic, DuckDuckGo ve Mistral — da kullanıcı kaynaklı fetch'ler işletiyor ve beşi de bu dönemde göründü. Bu ölçüme göre sitedeki Perplexity trafiğinin yüzde 93'ü, OpenAI'nin yüzde 21'i ve Anthropic'in yüzde 6'sı kullanıcı kaynaklıydı. Meta'nınki sıfırdı.

Yazar yorum konusunda dikkatli: eğitim yapan bir crawler'ın eğitim işi yapması suiistimal değil ve Meta amaçlarını açıkça beyan ediyor. Ancak yazıya göre bu karışım, bir şirketin şu anda bir sitenin yazısından ne istediğini gösteriyor ve sağlayıcılar arasındaki karışımlar çarpıcı biçimde farklı.

Yazarın tam olarak doğrulayamadığı bir ölçüm

Yazıda alışılmadık bir uyarı var. Meta bu crawler'lar için IP aralıkları veya reverse-DNS şeması yayınlamıyor; dolayısıyla Meta olarak kendini tanıtan 6.182 isteğin gerçekten Meta'dan gelip gelmediğini doğrulamanın bir yolu yok. Yazar sahteciliği olası görmüyor — hacim istikrarlı ve davranış tutarlı — ama sitenin en büyük okuyucusunun aynı zamanda en az doğrulanabilir okuyucu olduğunu açıkça söylüyor.

Diğer kör noktalar da kabul ediliyor. Önbellekten sunulan sayfalar hiç kaydedilmiyor, dolayısıyla her sayı toplam değil bir alt sınır. Masaüstü veya telefon uygulaması olarak çalışan AI istemcileri referrer göndermiyor, yani bir bağlantıyı takip eden insanlar analitikte doğrudan trafik olarak görünebiliyor. Ve site tek bir veri noktası: Filipinler'deki bir şehir hakkında, tek konulu, tek dilli ve tek bir yayın ritmine sahip bir Japonca yayın.

Belirtilmesi gereken bir not: Yazar, tüm hesaplamaları sunucuda yerel olarak çalışan AILYS Lens adlı ücretsiz bir WordPress eklentisi olan ölçüm aracını geliştiriyor. Aynı araçla yapılan önceki bir yazıda, site ayda kabaca on bin bot okuması ve iki kayıtlı insan varışı kaydetmişti — biri ChatGPT'den, biri DuckDuckGo'dan.

Neden önemli

Bir web sitesi işleten herkes için AI crawler trafiğinin hacmi değil bileşimi, bir sağlayıcının varlığının tamamen çıkarıcı mı yoksa yönlendirme trafiğine makul bir yol taşıyıp taşımadığını gösteriyor. Bu sitede okuyucuları geri yönlendirebilecek crawler, içeriği götüren crawler'ın hacminin yaklaşık yüzde ikisinde çalıştı ve kullanıcı kaynaklı fetch hiç tetiklenmedi.

Bu asimetri, robots.txt kuralları, rate limiting ve engelleme kararlarıyla doğrudan ilgili, çünkü tolere edilen crawler yükünün karşılığında ne elde edildiğini çerçeveliyor. Doğrulama boşluğu sorunu büyütüyor: en çok istek üreten sağlayıcı, site sahiplerinin en az kimliklendirebildiği sağlayıcı da ve bu, ayrıntılı erişim kontrolünü zorlaştırıyor.

Bir site ve bir ay bir sayım değil; yazar da bunu söylüyor. Ama yöntemi taklit etmek ucuz ve temeldeki soru — sitenizi kim okuyor ve neden — her operatörün yaklaşık bir haftada toplamaya başlayabileceği gerçek bir cevaba sahip.

  • #ai-crawlers
  • #meta
  • #web-traffic
  • #analytics
  • #wordpress