deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Yapay zeka tarayıcıları artık git.kernel.org'un CPU kapasitesinin yaklaşık %20'sini tüketiyor

git.kernel.org'un işletmecileri, tarayıcıların günde 6 milyon istek ürettiğini ve sunucu kapasitesinin yaklaşık beşte birini işgal ettiğini, proof-of-work savunmalarının artık botlar tarafından çözüldüğünü söylüyor.

Yapay zeka tarayıcıları artık git.kernel.org'un CPU kapasitesinin yaklaşık %20'sini tüketiyor

İşletmeciler tarayıcı sorununu rakamlarla ortaya koyuyor

Linux çekirdeği geliştirmesini barındıran altyapı olan git.kernel.org'un işletmecileri, yapay zeka tarayıcılarının hizmet üzerinde kalıcı bir yük haline geldiğini ve neredeyse hiçbir insanın okumayacağı sayfaları render etmek için CPU kapasitesinin yaklaşık beşte birini tükettiğini söylüyor.

Sitenin işletmecilerinden birinin people.kernel.org'da yayımladığı ve Hacker News ana sayfasına ulaşan bir yazıya göre, beş coğrafi olarak dağıtılmış düğüm üzerine yayılmış 90 CPU çekirdeğinden 14 ila 16'sı sürekli olarak tarayıcılar için git commit'lerini HTML olarak render etmekle meşgul. Artık meşru erişimin tüm biçimlerinin toplamından — git clone işlemleri dahil — daha fazla işlem gücü tarayıcılara hizmet etmeye harcanıyor.

Kazımanın ölçeği

Yazıya göre git.kernel.org, rastgele commit'leri görüntülemek isteyen günde yaklaşık 6 milyon istek alıyor. Anubis projesine dayanan bir proof-of-work zorluğu bunların %66'sını anında reddediyor, ancak kalan üçte biri matematik problemi çözerek siteye ulaşıyor. İşletmeci, cömret varsayımlar altında bile meşru isteklerin trafiğin yalnızca yaklaşık %2'si olduğunu, geri kalanının tamamının kazıma olduğunu tahmin ediyor.

İstek örüntüleri bunu ele veriyor: Linux deposunun çoktan terk edilmiş fork'larındaki eski commit'lere yapılan tekrarlı isteklerin, gerçek iş yapan geliştiricilerden gelmesi pek olası değil.

Çekirdek geçmişi neden hedefte

Linux geliştirmesi baştan sona açık şekilde yürüyor; klonlanabilir depolardan arşivlenmiş tartışmalara kadar her şey erişilebilir ve yazı bu durumun onu özellikle değerli bir eğitim materyali haline getirdiğini savunuyor. Model üretimi metinle eğitim yapmak dil modellerini bozduğu için, LLM öncesi döneme ait olduğu kesin olan bir derlem — örneğin çekirdeğin tam commit geçmişi — birinci sınıf veri olarak görülüyor.

İşletmecinin de dikkat çektiği ironi şurada: her şey zaten en verimli biçimde sunuluyor — düz bir git clone. Ana linux.git deposu yaklaşık 1,48 milyon commit içeriyor ve git.kernel.org bunun yaklaşık 922 fork'unu barındırıyor; bu fork'lar aynı temel nesneleri paylaştıkları için arka uçta ucuz kalıyorlar. Tarayıcılar bir kez klonlamak yerine, cgit ön yüzünün üretebileceği devasa sayıda geçerli URL'yi istiyor — commit sayfaları, yamalar, düz metin render'ları ve rastgele commit'ler arasındaki diff'ler — aynı içeriğin kopyalarını tekrar tekrar indiriyor. Yazı bunu veriyi elde etmenin mümkün olan en verimsiz yolu olarak nitelendiriyor.

Engelleme silah yarışı nasıl gelişti

Savunmalar adım adım evrildi ve botlar ayak uydurdu:

Önce user-agent dizgileriyle kendini tanıtan botlar yasaklandı. Sıradan tarayıcı kimlikleri taklit etmeye başlayınca yasaklar IP düzeyine taşındı. Tarayıcılar alt ağlara yayılınca, bulut sağlayıcılarıyla ilişkili ağ blokları tamamen kapatıldı ve bu arada zaman zaman meşru otomasyon da zarar gördü.

Sonra trafik, her biri sonsuza dek kaybolmadan önce yalnızca birkaç istek yapan milyonlarca konut ve mobil IP adresine kaydı. Bu adresleri yasaklamak anlamsız, çünkü bir daha geri dönmüyorlar; yazı bu örüntüyü proxy SDK para kazanma modellerine bağlıyor — tüketici cihazlarının, muhtemelen akıllı TV'lerin dahil, proxy uç noktası olarak kullanıldığı düzenler.

Proof-of-work zorluğu başlangıçta gerçek bir rahatlama sağladı. Botlar zorluk seviyesi 4'ü çözmeye başlayınca seviye 5'e yükseltildi; bu, bir telefonda saniyeler süren sayı hesabı gerektiriyor ve cihazı ısıtıyor. Botlar artık zorluk 5'i de çözüyor ve işletmeci, hangi zorluk çözücülerin otomatik olduğunu güvenilir biçimde ayırt etmenin artık mümkün olmadığını söylüyor.

Dikkat çekici olan, tarayıcıların siteyi çökertmemiş olması. Yazıya göre kesintilerin olağan sebebi, kötü tasarlanmış CI sistemlerinin depoları birçok düğümden aynı anda shallow-clone etmesi. Tarayıcı yükü, tek bir ölümcül darbe değil, dalgalar halinde gelen sürekli bir tahribat.

Bundan sonra ne değişecek

Taranabilir yüzeyi daraltmak için işletmeciler özellikleri kaldırıyor ve pahalı işlemleri kısıtlıyor. Anonim ziyaretçiler bazı işlevleri kaybedecek; yazı bunu istenmeyen ama gerekli bir ödün olarak nitelendiriyor. Yazar, her gün yeni yapay zeka girişimlerinin, hepsi eğitim verisine aç olarak, ortaya çıktığı sürece basit bir çözüm görmüyor; olası sonlar ya yapay zeka sektörünün bir daralması ya da tarayıcıların sonunda depoları klonlama gibi verimli yola geçmesi.

Neden önemli

Bu, yapay zeka tarayıcı trafiğinin operasyonel bir maliyet olarak en net sayısallaştırılmış anlatımlarından biri. Linux geliştirmesinin merkezindeki kamusal bir kaynak, kapasitesinin yaklaşık %20'sini botlara kaybediyor ve önlemler — proof-of-work zorlukları ve özelliklerin kaldırılması — hizmeti insanlar için yan hasarla kötüleştiriyor.

Ayrıca standart savunmaların ne kadar hızlı sırayla düştüğünü de belgeliyor: user-agent filtreleme, IP yasakları, ASN blokları ve şimdi proof-of-work'ün her biri aşıldı ve kazıma trafiği, filtrelenmesi neredeyse imkânsız olan konut proxy ağlarına kaydı. Geniş bir URL uzayına sahip kamusal bir site işleten herkes için kernel.org deneyimi, işlerin nereye gittiğinin bir önizlemesi: Sorun artık yapay zeka tarayıcılarının gelip gelmeyeceği değil, alışverişte kapıya kadar teslim edilecek teslimat elemanının kuryeye teslimat ücreti ödeyip ödemeyeceğidir.

  • #ai-crawlers
  • #linux
  • #git
  • #web-scraping
  • #web-operations

İlgili yazılar