· kaynak TechCrunch
Microsoft yöneticisi yapay zekâ kazımasını 'insanlık tarihinin en büyük emek hırsızlığı' olarak tanımladı, dosyalarda yer alıyor
Gizliliği kaldırılan NYT - OpenAI/Microsoft dosyaları, bir Microsoft yöneticisinin yapay zekâ kazımasını 'insanlık tarihinin en büyük emek hırsızlığı' olarak nitelemesini, ayrıca paywall aşımlarını ve büyük ölçekli kopyalamayı ayrıntılarıyla ortaya koyuyor.

The New York Times'ın OpenAI ve Microsoft'a karşı açtığı telif hakkı davasındaki yeni açıklanan belgeler, sanıkların kendi saflarından gelmiş en sert ifadelerden bazılarını içeriyor, diye bildiriyor TechCrunch. Ocak 2023 tarihli bir iç notta Microsoft Uygulamalı Bilim Direktörü Brent Hecht, kitlesel yapay zekâ kazımasını "akıl almaz boyutlarda bir hırsızlık" ve "insanlık tarihinin en büyük emek hırsızlığı" olarak tanımladı. OpenAI'de ise üst düzey isimler, chatbot ürünlerini, kendilerini eğiten yayıncılar ve gazeteciler için "varoluşsal bir tehdit" olarak nitelendirdi.
TechCrunch'ın dile getirdiği bir uyarı: Yeni ayrıntıların büyük kısmı, halen mühürlü olan delillerden değil Times'ın kendi hukuki dilekçesinden geliyor ve alıntılanan pasajlar özgün bağlamlarından yoksun biçimde yer alıyor.
Microsoft'un kendi 'kıyamet döngüsü' uyarısı
Dosyaya göre Microsoft'un iç verileri, Copilot'un "cevap motoru"nun Times alan adına yönelik tıklama oranlarını geleneksel Bing aramasına kıyasla yüzde 93'e varan oranda düşürdüğünü gösteriyordu. Hecht'in yazdığı bildirilen Ocak 2024 tarihli bir sunum, bu dinamiği "modellerimizin ve tüm web'in performansını aynı anda zarara uğratacak" bir "kıyamet döngüsü" olarak tanımladı.
Dilekçede alıntılanan başka bir Microsoft belgesi, tamamlanmış bir ürünün vazgeçilmez tedarikçilerinin ekonomik temellerini tehdit etmesinin "çok olağandışı" olduğunu kabul ediyor ve bunun şirketin LLM işi ile "içerik tedarik zinciri" için yarattığı durumun tam olarak bu olduğunu ekliyor. Ayrı bir iç değerlendirme, üretken yapay zekânın, temel modelleri eğiten verilerin sahibi olan insanların istihdamını ciddi biçimde bozma "gerçek riski" taşıdığı konusunda uyarıda bulunuyordu.
Yöneticiler yemin altında ne söyledi
Bu yılın başlarında ifadesine başvurulan Microsoft CEO'su Satya Nadella, "grounding veya eğitim amacıyla kullanılmak istenen her ücretli içerik lisanslanmalıdır" ifadesiyle tanıklık etti ve OpenAI'nin ücretli içeriklerle eğitim yaptığından haberdar olsaydı, OpenAI'ye modellerini yeniden eğitme zorunluluğu dayandırma hakkını kullanacağını söyledi. Ayrıca bir botla sohbet etmenin, ilgili kaynağın web sitesini ziyaret etmenin yerine geçebileceği konusunda da hemfikir oldu.
OpenAI cephesinde ChatGPT sorumlusu Nick Turley, yayıncıların chatbotların yarattığı "varoluşsal tehdit"le karşı karşıya olduğunu ve bu chatbotların "büyük ölçüde ikame edici" olduğunu, "iyileştikçe daha da ikame edici hale geleceklerini" iç notlarında yazdı. OpenAI Başkanı Greg Brockman ise modelleri "haberlerde mükemmel" olarak tanımladı.
Kopyalamanın ölçeği
Dosya, söz konusu hacme ilişkin ilk bakışı sunuyor. Bildirildiğine göre yalnızca OpenAI'nin eğitim ortası veri kümeleri, Times, Daily News ve Center for Investigative Reporting tarafından yayımlanan eserlerin 91.692'den fazla kopyasını içeriyor; Common Crawl'dan türetilen bir veri kümesinde ise yalnızca nytimes.com'dan iki milyondan fazla belge vardı.
Dosyaya göre iki şirket doğrudan veri alışverişinde de bulundu: OpenAI, OpenAI modellerinin ticari ürünlere nasıl yerleştirileceğini değerlendirmek için Microsoft'a GPT-3 eğitim veri setinin tamamını teslim etti; Microsoft da Project Taxi ve Project Mango kod adlı çabalarla karşılığında eğitim verisi sağladı. Project Mango materyalinin, haber yayıncılarının en az 160.903 benzersiz eserinin kopyalarını içeren bir veri kümesinde derlendiği iddia ediliyor.
Paywall'lar ve telif hakkı bildirimleri
Açığa çıkan pasajlar içeriğin nasıl elde edildiğini anlatıyor. OpenAI araştırmacısı Nick Ryder, Brockman'a "nytimes paywall'ını aşmanın bir yolunu" bildirdiğinde Brockman'ın "ah güzel" diye yanıtladığı bildiriliyor. WebText ve WebText2 gibi iç veri kümeleri orantısız biçimde kazınmış haberlere dayanıyordu, Common Crawl'dan milyonlarca makale çekildi ve çalışanların, eğitim verisini modellere iletmeden önce telif hakkı bildirimlerini çıkardığı iddia ediliyor — kısmen, dosyadaki ifadeyle araştırmacılar bu tür bildirimlerin kullanıcılara çıktı olarak verilmesini "istemedikleri" için.
TechCrunch, OpenAI'nin de Microsoft'un da yorum taleplerine yanıt vermediğini belirtiyor.
Baskı altındaki fair use
Yapay zekâ şirketlerinin telif hakkıyla korunan materyalle yasal olarak eğitim yapıp yapamayacağı hala belirsizliğini koruyor, ancak şu ana kadar mahkemeler fair use argümanlarına büyük ölçüde sıcak yaklaştı ve bu ayın başlarında Trump yönetimi, OpenAI'nin eğitim için telifli eserleri lisanssız kullanımını savunan bir dilekçe sundu. Yeni itiraflar, doğrudan fair use testinin bir unsuruna — kullanımın özgün eserin pazarının yerine geçmemesi veya ona zarar vermemesi gerekliliğine — değindikleri için önemli. Çöken tıklama oranlarını gösteren iç veriler ve yöneticilerin yemin altında chatbotları ikame edici olarak tanımlamaları bu savunmayı zorlaştırabilir.
Neden önemli
Dosyalar, sanıkların iç değerlendirmelerini hukuki pozisyonlarıyla doğrudan çelişkiye düşürüyor. Microsoft'un kendi bilim insanlarının ve CEO'sunun hırsızlık, lisanslama yükümlülükleri ve ikame konusunda yaptığı açıklamalar, pazar zararı konusunda — birkaç bekleyen yapay zekâ telif hakkı davasının nihayetinde üzerinde dönabileceği soru — dönüm noktası olabilecek kanıtlara dönüşebilir. Yayıncılar için belgeler, çıktılarının ne kadarının eğitim külliyatına girdiğine ve paywall'lara ve telif hakkı bildirimlerine ilişkin iddiaya göre nasıl aşıldığına dair şimdiye kadarki en ayrıntılı hesabı sunuyor. Ve genel olarak web için Microsoft'un "kıyamet döngüsü" çerçevesi — cevap motorlarının bağımlı oldukları kaynakları aç bırakması — bu tek davadan çok daha öteye uzanan riskleri gözler önüne seriyor.
- #copyright
- #openai
- #microsoft
- #fair-use
- #new-york-times
- #ai-training