deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Cloudflare blog

Cloudflare, sitelere arama görünürlüğünü kaybetmeden AI eğitimini engelleme imkânı sunuyor

Cloudflare'ın yeni Disallow AI Training ayarı, Googlebot gibi karma amaçlı crawler'ların bir sitenin içeriğiyle eğitim almasını engellerken sitenin aramada görünür kalmasını sağlıyor; Apple, Google ve Microsoft bu ayarı destekliyor.

Cloudflare, sitelere arama görünürlüğünü kaybetmeden AI eğitimini engelleme imkânı sunuyor

Cloudflare, arama görünürlüğü ile AI eğitimi arasındaki bağı koparan bir bot kontrolü sundu. Disallow AI Training adlı bu ayar, sitenin robots.txt dosyasına bir eğitim yasağı talimatı yazarken, karma amaçlı crawler'ların siteyi arama için indekslemesine izin vermeye devam ediyor. Cloudflare bloguna göre Apple, Google ve Microsoft bu ayarı ya şu anda uyguluyor ya da belirtilen bir süre içinde uygulamayı taahhüt etmiş durumda.

Karma amaçlı crawler'ların yarattığı sorun

Web'deki en büyük operatörlerden bazıları, aynı anda hem arama indeksi oluşturan hem de model eğitimi için veri toplayan tek bir crawler çalıştırıyor. Cloudflare bunlara örnek olarak Applebot, Bingbot ve Googlebot'u gösteriyor. İki işlev tek bir crawler'da birleştiği için, bir kullanımı reddeden site sahibi otomatik olarak diğerini de reddediyordu — eğitimi durdurmak, arama sonuçlarından yok olmak anlamına geliyordu.

Cloudflare'ın kendi verileri, site sahiplerinin tercihlerinin ne kadar dengesiz olduğunu gösteriyor: ağındaki sitelerin yüzde 1'inden azı arama botlarını engellerken, yüzde 17'si eğitim engellemek için bir mekanizma kullanıyor. Tek bir ya hep ya hiç düğmesi bu gerçeğe uymuyordu.

Yeni ayar nasıl çalışıyor

Disallow AI Training, Cloudflare'ın Bot Preference Sync adını verdiği bir özellik üzerinden çalışıyor; bu özellik, ilgili eğitim yasağı direktifini sitenin adına robots.txt dosyasına yazıyor. Hesap verebilir (Accountable) olarak sınıflandırılan karma amaçlı crawler'lar arama için taramaya devam edebiliyor, diğer tüm eğitim crawler'ları ise tamamen engelleniyor — Cloudflare'ın belirttiğine göre aramayı hiç etkilemeden engellenebilen, Amazon, Anthropic, Meta ve OpenAI'ın yalnızca eğitim amaçlı crawler'ları da dahil.

Bu ayar, revize edilmiş alan adı düzeyindeki seçenekler menüsüne katılıyor: Allow, Disallow AI Training, Block on pages with ads ve Block. Disallow seçeneğinin yalnızca reklamlara uygulanacak bir varyantı yok, çünkü robots.txt büyük ve sürekli değişen bir reklam sayfası listesini numaralandıramıyor. Henüz agent'lar için de bir disallow ayarı bulunmuyor; Cloudflare, ai-prefs gibi standartlar olgunlaştıkça bunu yeniden değerlendireceğini söylüyor.

Accountable unvanı

Uygulama, yalnızca robots.txt'ye değil, Cloudflare'ın ağına dayanıyor. Cloudflare'ın da işaret ettiği gibi, robots.txt kimin taradığını tespit edemez, neden taradığını anlayamaz ya da kendini yok sayan bir crawler'ı durduramaz. Cloudflare bunun yerine tercihi yayımlıyor, crawler'ı doğrulayıp sınıflandırıyor, bunu yok sayanları engelliyor ve her operatörün gerçekte ne yaptığını Radar servisinde yayımlıyor.

Bu tercihleri saygıyla karşılayan operatörleri tanımak için Cloudflare, Accountable adında bir unvan oluşturdu. Bu unvanı kazanmak için bir operatör, şimdi ya da süreli bir taahhüt kapsamında şunları sunmalı: robots.txt ya da eşdeğer bir standart üzerinden AI eğitimi opt-out'u, AI özetlerinden opt-out'u, hangi sayfaların eğitimde kullanıldığına dair URL düzeyinde görünürlük ve içeriğin aramada nasıl göründüğüne dair metrikler, ayrıca eğitimden çıkışın normal arama sonuçlarını değiştirmeyeceğine dair güvence. Apple, Google ve Microsoft'un üçü de bu çıtayı karşılıyor; mevcut yeteneklerini hâlâ geliştirilmekte olan özelliklere ilişkin tarihli taahhütlerle birleştiriyorlar. Cloudflare ayrıca Temmuz'dan bu yana crawler operatörleriyle doğrudan görüşmelere devam ettiğini ve neredeyse tamamının site sahiplerinin içeriklerinin nasıl kullanıldığı konusunda kontrol ve şeffaflığı hak ettiğini kabul ettiğini ekliyor.

15 Eylül'de ne değişti

Yeni ayarın yanı sıra Cloudflare, mevcut kontrollerin davranışını da değiştirdi. Block ve Block on pages with ads artık karma amaçlı crawler'lara da uygulanıyor; yani her iki seçim de aramayı eğitimle birlikte etkiliyor. Eski "Block AI Bots" düğmesi, ayrı Search, Training ve Agent kontrolleri lehine kullanımdan kaldırılıyor, Managed Robots.txt ise Bot Preference Sync lehine emekliye ayrılıyor. Disallow AI Training ayrıca bazı yeni alan adları için önerilen yapılandırmanın parçası haline geliyor.

Mevcut müşterilerin çoğunun hiçbir şey yapması gerekmiyor, çünkü tercihler otomatik olarak taşınıyor. İnce ayarlı kontrolleri hiç kullanmamış alan adları, eski "Block AI Bots" ayarlarına göre taşınacak. Karma amaçlı crawler'ları tamamen istemeyen site sahipleri artık bunu açıkça belirtmek zorunda; Block'u seçmek Applebot, Bingbot ve Googlebot'un siteye erişimini durduruyor — arama dahil.

Neden önemli

Açık web'in büyük kısmı reklam, abonelik ya da doğrudan okuyucu ilişkileriyle finanse ediliyor ve bu modeller ancak biri gerçekten bir siteye geldiğinde karşılığını veriyor. Eğitim crawler'ları hiç trafik getirmez. Cloudflare'ın ayarı yayıncılara daha önce var olmayan bir orta yol sunuyor: aramada tamamen görünürken model eğitimine kapalı olmak. Ayrıca uygulamayı gönüllü robots.txt uyumundan, kamusal raporlamayla ağ düzeyinde doğrulamaya kaydırıyor — bu, crawler hesap verebilirliğinin Cloudflare'ın çok ötesinde nasıl işleyeceğini şekillendirebilecek bir model. Sıradaki sınır da şimdiden görünürde: Cloudflare, Accountable statüsü için AI özetlerinden opt-out şart koşuyor ve gelecek yıl başına kadar sitelere içeriklerinin özetlerde ne kadar görüneceğini kontrol etme imkânı vermeyi hedeflediğini söylüyor — her operatörle ayrı ayrı pazarlık etmek yerine tek bir yerden bir kez ayarlanarak.

  • #cloudflare
  • #ai-crawlers
  • #robots-txt
  • #seo
  • #web-crawling

İlgili yazılar