· kaynak dev.to (home feed)
Crossref, Transformer makalesinin 2025 tarihli beş sahte kopyasını listeliyor
Bir dev.to yazısı, 2017 tarihli Transformer makalesini 2025 yayınları olarak yeniden yayımlayan beş Crossref kaydı buldu; oysa gerçek NeurIPS özgün makalesinin hiç Crossref DOI'si yok.

Ortaya çıkanlar
3 Eylül 2026 tarihli bir dev.to yazısına göre, Crossref'te "Attention Is All You Need" — Transformer mimarisini tanıtan ve yazıya göre 140.000'den fazla atıf almış 2017 tarihli Vaswani vd. makalesi — için arama yapmak beş ayrı kayıt döndürüyor. Bunlar aynı başlığı ve aynı sekiz yazarı paylaşıyor ve başka yönden ayırt edilemezler; ancak her birinin yayın yılı 2025 olarak görünüyor.
Beşi de 10.65215 önekli DOI'lara sahip (10.65215/r5bs2d54, 10.65215/ysbyhc05, 10.65215/mdcm8z23, 10.65215/nxvz2v36 ve 10.65215/2q58a426). Yazıya göre bu önek bir machine learning mekanına değil, kendini Shenzhen Medical Academy of Research and Translation diye tanıtan ve bir Çin preprint sunucusu üzerinden faaliyet gösteren bir kuruluşa ait. Yazar, her DOI'nin söylenene bakılmaksızın doğrudan kontrol edildiğini belirtiyor: beşi de canlı, dizine eklenmiş sayfalara çözümlendi; yani bu girdiler gerçek Crossref kayıtları ve arama araçlarının bir yan ürünü değil.
Orijinal kayıt neden yok
Kopyaların sonuçlarda öne çıkmasının nedeni, yazının açıkladığı gibi, gerçek 2017 NeurIPS makalesinin baştan beri hiç Crossref DOI'sine sahip olmaması. NeurIPS, ACL Anthology kapsamındaki mekanların aksine bildirileri için sistematik olarak DOI kaydetmiyor; dolayısıyla yalnızca Crossref'e yapılan bir başlık aramasının meşru olarak döndürebileceği bir şey yok. Sorgunun ürettiği sonuç yalnızca beş uydurma girdi.
Referans dosyalarında daha kapsamlı bir denetim
StrictCite adında tarayıcı tabanlı bir atıf denetleyicisi geliştiren yazar, kontrolü tek bir makalenin ötesine taşıdı. Son haftalardan birinin Hugging Face Daily Papers listesindeki en çok okunan on makaleyi alarak, her makalenin arXiv kaynağından gerçek .bib ve .bbl referans dosyalarını çıkardı ve 831 referansı on üç kayıt denetiminden geçirdi. 300'den fazlası işaretlendi; ancak yazı, bunun kayda değer bir kısmının gürültü olduğunu açıkça belirtiyor: Semantic Scholar'ın anahtarsız katmanı çalışmanın ortasında şiddetle hız limitine takıldı ve bu, bir referansın atıf yapan makaleyle ilgisiz nedenlerle doğrulanmamış gibi okunmasına yol açabiliyor.
Buna rağmen somut sorunlar ortaya çıktı. Bir makalenin atıf yılı 1609 olarak okunuyordu — bu bir tarih değil, bir bibliografya aracının yıl sanarak aldığı bir AAAI DOI parçasıydı (10.1609/...); yazar bu örüntüyü üç ayrı makalede bağımsız olarak bulduğunu bildiriyor. Başka bir örnekte, bir diffusion-model makalesi için atıf yapılan DOI, diffusion modelleriyle hiç bağlantısı olmayan dört yazara ait, otonom sürüş için insan faktörleri modellemesi üzerine ilgisiz bir makaleye çözümlendi.
OpenAI ve Meta'nın resmi dışa aktarımları da etkileniyor
Yazı ayrıca OpenAI ve Meta'nın kendi makaleleri için arXiv'in dışa aktarım uç noktası üzerinden yayımladığı BibTeX dosyalarını inceliyor. OpenAI'nin GPT-4o System Card dışa aktarımında ortak yazarlar arasında çıplak bir iki nokta yer alıyor. Meta'nın "The Llama 3 Herd of Models" dışa aktarımı ise gerçek insanları ikiye bölüyor: "Guangyi Zhang", "Guangyi" ve "Zhang" diye var olmayan iki ayrı kişiye dönüşüyor ve aynı hata "Yu Wang" için de yineleniyor. Yazının öne sürdüğüne göre olası neden, üretim araçlarında "and" dizgisinin yalnızca isimler arasında değil, bir ismin içinde yer alması.
Bozulma makaleyle sınırlı kalmıyor. Yazıya göre arXiv'in bildirimde bulunduğu kayıt mercii DataCite, aynı bozuk yazar listelerini kalıcı kayıtları olarak içine almış durumda. Bir kayıt mercisinin sözünü gerçeklik sayan bir araç her iki girdiyi de doğru işaretlerdi, çünkü hata kaynağın kendisinde, onun aşağısında değil.
Neden önemli
Atıfları kayıt verilerine karşı doğrulayan her şey bu mekanizmaya maruz. Doğru kayıt yokken — her kayıt merkezinin kapsam boşlukları var ve hepsi ara sıra erişilemez hale geliyor — tek bir spam kopyası mevcut tek cevap olabilir ve aşağı akıştaki araçlar onu yetkili kabul eder. Yazının vardığı sonuç, kayıt merkezlerinin genel olarak güvenilmez olduğu ya da atıf denetiminin anlamsız olduğu değil; bir kayıt merkezinin bir kaydı doğrulamasının, o kaydın doğru olmasıyla aynı şey olmadığı. Kanıtsal ağırlık taşıyan bağımsız kaynaklar arası teyittir ve tam olarak tek bir tanımadık kayıt merkezine dayanan bir iddia, kimse onu kesinleşmiş saymadan önce kuşkuyı hak eder. Modern dil modellerinin kurucu makalesinin olması gereken yerde duran beş 2025 sahtekârı, bu doğrulama katmanının ne kadar inceldiğinin küçük ama somut bir göstergesi.
- #crossref
- #scholarly-metadata
- #doi
- #citations
- #academic-publishing