deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Denetim, Perplexity'nin atıflarının üçte birinin gösterdikleri rakamları desteklemediğini ortaya koydu

Perplexity'nin arama modellerinin gösterdiği her kaynağı çeken bir denetim, rakam içeren atıfların yüzde 34,7'sinin açılmayan sayfalara ya da söz konusu sayıyı içermeyen sayfalara işaret ettiğini buldu.

Denetim, Perplexity'nin atıflarının üçte birinin gösterdikleri rakamları desteklemediğini ortaya koydu

Denetim ne buldu

Hacker News'in ön sayfasına çıkan Haus Research tarafından yayımlanan bir denetim, Perplexity'nin iki arama modeline 210 teknoloji şirketi hakkında 310 olgusal soru sordu, ardından gösterilen her kaynağı çekerek her sayfanın gerçekten kendisine atfedilen sayıyı içerip içermediğini kontrol etti. Rakam belirten cümlelere eklenmiş 1.826 atıftan yüzde 34,7'si, sıradan bir okuyucu için açılmayan ya da desteklediği cümledeki sayıların hiçbirini içermeyen bir sayfaya işaret ediyordu. Atıf başına değil iddia başına puanlandığında — bir iddia, gösterilen sayfalarından herhangi biri rakamlarından birini taşıyorsa geçiyor — 872 rakamlı iddianın yüzde 14,4'ü başarısız oldu.

Sorular, insanların gerçekten baktığı olguları kapsayan on şablon kullanıyordu: kuruluş yılı, son yatırım turu, çalışan sayısı, giriş düzeyi fiyatlandırma, genel merkez, gelir, açıklanmış ihlaller, güncel CEO, satın almalar ve ücretli katman çalışma süresi garantileri. Her iki Perplexity modeli, sonar ve sonar-pro, temperature 0'da çalıştı; kontrol grubu olarak web eklentili GPT-4.1 kullanıldı.

Her atıf nasıl test edildi

Perplexity'nin modelleri iddialara satır içi işaretçiler ekler ve her biri belirli bir URL'ye işaret eder; cümle düzeyinde denetimi mümkün kılan da budur. Denetçiler gösterilen her benzersiz URL'yi çektiler — yalnızca sonar için 2.915 — ve her birini ölü, erişim engelli, boş, erişilemez ya da canlı olarak sınıflandırdılar; başarısız çekimlere daha uzun timeout'lar ve dönen bir proxy üzerinden ek denemeler verildi ve bu, 192 URL'yi kurtardı.

Geçme testi bilerek gevşekti: iddianın para tutarları, yüzdeleri, yılları ve sayı dizileri çıkarılıyor, sayfanın görünür metni bunlardan en az birini içeriyorsa geçiyordu; $185 million, $185M ve 185000000'nin hepsinin eşleşmesi için normalizasyon yapılıyordu. Tek bir sayı, çıplak bir yıl bile yeterliydi. Bu, manşetteki yüzde 34,7'yi bir alt sınır haline getiriyor; çünkü başarısız her çift, kendisine atıf yapan cümledeki sayılardan hiçbirini içermeyen bir sayfadır.

Erişim engelli sayfalar ve tek kullanımlık SEO sayfaları

Ana sorun ölü bağlantılar değil: gösterilen URL'lerin yalnızca yüzde 1,3'ü ölüydü. Daha büyük kategori erişim engelli kaynaklar. Her altı atıftan biri, PitchBook, ZoomInfo, Crunchbase ve Reuters gibi ödeme duvarı ya da giriş duvarı olan sitelere işaret ediyordu. Cevap düzeyine toplandığında, sonar'ın 310 cevabının yüzde 84,2'si sıradan bir okuyucunun açamayacağı en az bir URL gösteriyordu ve yüzde 10,6'sı düpedüz ölü olan en az bir URL gösteriyordu.

Ölü bağlantıların ayırt edici bir biçimi vardı. Sonar'ın 38 ölü URL'sinin yaklaşık yarısı, şirkete ve soru türüne göre üretilen programatik sayfalardı — komo.ai'nin ofis dizinleri, apollo.io'nun where-is sayfaları ve temperstack.com'un plan sayfaları gibi yollar — tam olarak bu sorgularda sıralanmak için inşa edilmiş ve çıktıkları kadar ucuz şekilde kaldırılmıştı. Yazım gününde yapılan yeniden kontrollerde Elastic ofisler sayfası 404 döndürdü ve apollo.io'nun Reddit genel merkez sayfası 410 Gone döndürdü.

Açılan ama iddiayı içermeyen sayfalar

Sayfanın açıldığı ve okunabilir olduğu çiftler arasında yüzde 16,1'i iddianın rakamlarından hiçbirini içermiyordu. Vercel'in en ucuz ücretli planının giriş fiyatı sorulduğunda sonar, ilk ücretli katmanın ayda 20 dolardan başladığını söyledi ve planları adlandıran ama bu fiyatı içermeyen canlı bir sayfa olan Vercel'in kendi fiyatlandırma dokümantasyonunu gösterdi. Her iki model de genel merkez soruları için sokak adresleri üretti ve bunları sokak numarası ya da posta kodu içermeyen Wikipedia makalelerine atfetti — bazı cevaplar Wikipedia işaretçisini yine de eklerken birden fazla kaynağa dair temkinli ifadeler bile kullandı. Sonar, GitLab CEO'su Bill Staples'ı 5 Aralık 2024 başlangıç tarihiyle andı ama gösterdiği GitLab yönetici sayfası Staples'ı adlandırıyor, tarih içermiyordu.

Denetime göre başarısızlık, bir olgunun nasıl yayımlandığını izliyor. Çalışan sayısı ve kuruluş yılı, onlar için inşa edilmiş sayfalardaki yapılandırılmış alanlarda yaşar ve iyi durumda kalır; bir CEO'nun başlangıç tarihi ya da bir ofisin sokak numarası yaygın olarak tekrarlanır ama nadiren yayımlanır, dolayısıyla model mutabakatı yeniden üretir ve onu hiç taşımamış bir sayfayı gösterir. İddia ve atıf, gerçek bir geri getirmeden çok aynı üretken süreçten geliyor gibi görünüyor.

İki model aynı şekilde test ediliyor

Bir pilot çalışma, sonar-pro'nun iddialarını sonar'dan daha kötü temellendirdiğini öne çıkarmıştı, ama tam ölçekte bu fark kayboldu: sonar sayısal çiftlerin yüzde 65,9'unu geçti (yüzde 95 aralık 62,8–68,9), sonar-pro ise yüzde 64,7'sini (61,5–67,7); her iki model de cevap başına kabaca 9,8 kaynak gösteriyordu. Web erişimli GPT-4.1 farklı davrandı: cevap başına 2,0 kaynak gösterdi ve şirketlerin kendi alan adlarına daha fazla yaslandı (yüzde 36,4'e karşı Perplexity'nin yüzde 23,4'ü). Satır içi işaretçi yaymadığı için cümle düzeyinde kontrol imkânsız — bu da cevap sonundaki kaynakçalar hakkında başlı başına bir bulgu.

Sonar'ın atıfları 989 ayrı host'a yayıldı; yüzde 23,4'ü şirketin kendi alan adına, yüzde 23,1'i B2B dizinlerine ve müşteri listelerine gitti. LinkedIn, yüzde 5,6 ile en büyük tek host'tu ve Wikipedia'nın yüzde 4,3'ünün önündeydi; dizin sayfaları en az dayanıklı çıktı: yalnızca yüzde 66,0'ı açıldı, genel olarak atıfların yüzde 78,7'sine karşılık.

Neden önemli

Atıflar Perplexity'nin temel vaadidir — arama temelli bir cevabı makul görünen üretimden ayıran özellik. Denetim bu vaadin sık sık doğrulanamaz olduğunu öne sürüyor: sayısal atıfların üçte biri ya açılamıyor ya da gösterilen rakamı içermiyor ve erişim engelli dipnotlar hiçbir okuyucunun test edemeyeceği köken iddiaları sunuyor. Perplexity'nin sonar API'leri üzerine inşa eden ekipler için pratik ders şu: satır içi işaretçiler temellendirmeyi ölçülebilir kılar, dolayısıyla atıf doğruluğu kullanım senaryosuna göre test edilmeli — ve bir dipnotun varlığından varsayılmamalı.

  • #ai
  • #perplexity
  • #search
  • #citations
  • #llm

İlgili yazılar