· kaynak Hacker News – Front Page (native)
6.851 öğrenci oyuyla yapılan kör testte Gemini, kompozisyon yazımında ChatGPT ve Claude'ın önünde
StudyArena'nın Ağustos 2026 kör karşılaştırma verileri, öğrencilerin kompozisyon yanıtlarını %39,6 oranında Gemini'den seçtiğini gösteriyor; Claude %31,8, OpenAI modelleri ise %29,2'de kaldı.

Gemini, 6.851 oylu kör karşılaştırmada önde
StudyArena, öğrencilerin yapay zeka yanıtlarını yan yana karşılaştırıp hangi modelin kazandığını ancak oy verdikten sonra öğrendiği bir site; yeni verilerine göre model isimleri gizlendiğinde öğrenciler kompozisyon yazımında ChatGPT ve Claude yerine Gemini'yi tercih etti. 25 Ağustos'ta Hacker News'in ana sayfasına da yansıyan bulgular, platformun Ağustos 2026 veri setinden gelen 6.851 geçerli kör oya dayanıyor.
Yazma ve kompozisyon görevlerinde Google'ın Gemini ailesinden yanıtlar %39,6 oranında seçildi; Anthropic'nin Claude'ı %31,8, ChatGPT dahil OpenAI modelleri ise %29,2'de kaldı. StudyArena, veri setini kimliği kaldırılmış toplu üretim verisi olarak tanımlıyor; iç ve yönetici etkinlikleri ile geçersiz oylar hariç tutulmuş, güncel model varyantları sağlayıcı ailesine göre gruplanmış. Arena, birçok karşılaştırmada hâlâ anılan eski nesiller yerine en yeni amiral gemisi sürümleri kapsıyor: Gemini 3.1 Pro, Claude Opus 5 ve GPT-5.6 Sol.
Kör format işin özü: Bir model için zaten para ödeyen ya da başka bir modelin daha iyi yazdığına inanan öğrenci, yine de logoya değil sayfadaki metne göre karar vermek zorunda.
Uzun yanıtlar kazanma eğilimindeydi
Uzunluk tercihle ilişkiliydi. Seçilen yanıt, yendiği alternatiflerden ortalama %37 daha uzundu ve en uzun yanıt, kesinleşen yazma oylarının %47,7'sini kazandı. Kısa yanıtlar umutsuz değildi; en kısa yanıt yine de %25,0 oranında kazandı, ancak bu havuzda kısalık açıkça kazandıran bir strateji değildi.
Yüksek reasoning ayarları daha kötü puan aldı
Daha sezgilere aykırı bulgu ise reasoning eforuyla ilgili. Efor etiketleri yükseldikçe seçilme oranları düştü: düşük efor ayarları %40,7, orta %33,3, varsayılan %30,8 ve yüksek %29,5 oranında kazandı.
StudyArena'nın açıklamasına göre ekstra reasoning, modele madde madde nokta, kayıt ve tekrar yığınca alan tanıyor; bu bir ispat veya araştırma planında işe yarayabilir ama düzyazıyı zayıflatma eğiliminde. Kompozisyon işi için pratik önerisi, normal veya düşük efor ayarıyla başlamak ve yalnızca zor kısım cümleyi yazmak değil kanıtları akıl yürütmek olduğunda daha yükseğe çıkmak.
Her sağlayıcı farklı bir aşamada öndeydi
Genel yazma önerisini Gemini alsa da uzmanlık rakamları göre göre bölündü. Gemini mevcut taslaklara geri bildirimde %41,7 ile öndeydi; bu da onu bir taslak mevcut olduğunda ve teşhis gerektiğinde StudyArena'nın önerdiği başlangıç noktası yapıyor. Claude ödev planlamasında %43,2 ile öndeydi; özellikle rakip yapılar üretme ve artı-eksilerini tartmada. OpenAI modelleri ise %39,3 ile araştırma işinde öndeydi; iddiaları, itirazları ve doğrulanması gereken gerçekleri haritalama gibi.
Başka bir deyişle hangi modelin önde çıkacağı, kompozisyon sürecinin hangi bölümünün test edildiğine bağlıydı.
Rakamlara ne kadar güvenmeli
Bir miktar temkinli olmak gerekiyor. Veriler kendi karşılaştırma aracına ticari çıkarı olan tek bir platformdan geliyor; oy veren popülasyon rastgele bir örneklem değil, kendini seçmiş öğrencilerden oluşuyor ve güven aralıkları ya da hata payları yayınlanmamış. StudyArena ayrıca makalelerini taslaklamak ve analiz etmek için yapay zekadan yararlanabileceğini açıkça belirtiyor. Liderlik tablosu canlı ve yeni oylar geldikçe değişmeye devam edeceği için sıralama kesinleşmiş bir hüküm değil, bir anlık görüntü.
Neden önemli
Kompozisyon yardımı, öğrencilerin chatbot kullanmanın en yaygın yollarından biri ve bu ölçekte ölçülebilir bir tercih kayması, tüketici sadakatinin nereye kayabileceğine dair erken bir sinyal. Sonuçlar, sıralamanın kendisinin ötesinde iki pratik çıkarım daha taşıyor: liderlik göreve bağlı ve her sağlayıcı yazma sürecinin farklı bir aşamasında en güçlü; ayrıca reasoning eforunu yükseltmek düzyazı çıktısını gerçekten kötüleştirebiliyor ve kullanıcıların hemen test edebileceği bir ayar değişikliği bu. Son olarak, kör arenalar laboratuvar benchmark'larına yararlı bir tamamlayıcı olarak ortaya çıkıyor; çünkü testlerde iyi puan alanı değil, insanların gerçek görevlerde gerçekte neyi tercih ettiğini ölçüyorlar.
- #gemini
- #chatgpt
- #claude
- #ai-writing
- #blind-testing
İlgili yazılar
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- OpenAI, GPT-6 Astra ve Astra Pro'nun ChatGPT, API ve bulut platformlarındaki aşamalı sunumuna başladı
- Anthropic'ın kendi status page'ine göre Claude yaklaşık 24 günde 20 olay kaydetti