deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Ön kayıtlı test: 12 LLM'den 10'u, geçmiş bilançoların sonuçlarını yalnızca şirket adı ve tarihten hatırlıyor

3.708 bilançodan oluşan ön kayıtlı bir testte, GPT-6 Astra yalnızca bir şirket adı ve tarih verildiğinde beklentiyi aşan bilançoyu %91 oranında doğru seçti; bazı modeller ise hiçbir hatırlama göstermedi.

Ön kayıtlı test: 12 LLM'den 10'u, geçmiş bilançoların sonuçlarını yalnızca şirket adı ve tarihten hatırlıyor

Deney

dev.to'da yazan bir geliştiriciye göre, ön kayıtlı bir test, mevcut büyük dil modellerinin yalnızca bir şirketin kimliği ve bir tarih verildiğinde geçmiş bilançoların nasıl sonuçlandığını hatırlayıp hatırlayamadığını sordu. Veri seti, Ocak 2023 ile Ağustos 2026 arasındaki 250 S&P 500 şirketine ait 3.708 bilançoyu kapsıyordu. Her model şirket adını, ticker'ı, borsayı, sektörü ve duyuru tarihini gördü, ardından üç soruya olasılık atadı: EPS beklentiyi aştı mı, hisse iki günlük tepki döneminde S&P 500'ü yendi mi ve sonraki 20 işlem gününde endeksi geride bıraktı mı.

Puanlama şirketler arası değil, şirket içi: Test eden kişi, her şirket için sonucun farklı olduğu aynı çeyreğe ait 2023 ve 2024 raporlarını alır ve modelin doğru olanı ne sıklıkla daha yüksek puanladığını sayar. Bu, 0,5'in modelin ikisini ayırt edemediği anlamına geldiği bir şirket içi AUC verir. Protokoller, model listesi ve her istek, her turun ilk çağrısından önce OpenTimestamps ile hash'lenip zaman damgalanmış. On iki güncel model OpenRouter üzerinden çalıştırıldı; ayrıca Jev'in yerine geçmesi için yapılmış açık kaynak bir model olan von da test edildi.

Sonuçlar

GPT-6 Astra, 0,904'lük (95% GA 0,886 ile 0,921 arası) şirket içi AUC ile önde geldi; bu, beklentiyi aşan raporu %91 oranında doğru seçtiği anlamına geliyor. Onu 0,799 ile Gemini 3.8 Flash, 0,766 ile Claude Opus 5.5 ve 0,691 ile GPT-6 Sol izledi. Listede daha aşağıda: 0,603 ile Grok 4.7, 0,587 ile Claude Sonnet 5, 0,578 ile Qwen3.8 Max, 0,573 ile GPT-6 Luna, 0,551 ile DeepSeek V4.1 Flash, 0,541 ile von 1.2, 0,538 ile Kimi K3 ve 0,531 ile GLM-5.3. Jev 1.13 ve DeepSeek V4 Pro 0,504'te, Qwen3.8 Flash 0,498'de ve Llama 3.1 70B 0,490'da kaldı.

Testi yapan kişiye göre Holm düzeltmesinden sonra, DeepSeek V4 Pro ve Qwen3.8 Flash dışındaki tüm yeni API modelleri hafıza gösterdi; GLM-5.3 eşiği ancak geçebildi; von da bir miktar gösterdi. Sonnet 5, Jev ve Llama satırları çalışmanın daha erken bir turundan geldi.

Testi yapan kişinin beklemediği bulgular

Fiyat ve boyut, bir aile içindeki hatırlamayı öngörmedi. DeepSeek V4 Pro hiçbir şey göstermezken V4.1 Flash gösterdi; Qwen3.8 Max hatırlarken Qwen3.8 Flash hatırlamıyor. Küçük bir açık kaynak model olan von 0,541 puan aldı; Jev ise 0,504'te kaldı; yani bir modeli yerel olarak çalıştırmak onu temizlemez. Ucuz katman da hatırlıyor: GPT-6 Luna 0,573'e ulaştı ve 3.708 çağrısının tamamı 0,15 Amerikan doları tuttu.

Öne çıkan üç model de dahil olmak üzere altı endpoint, reasoning'i kapatmaya izin vermedi ve en düşük çaba ayarında çalıştı; bu yüzden testi yapan kişi ezberlemeyi, biraz reasoning'in eklediği etkiden ayıramıyor.

Uyarılar

Tek bir prompt, 250 şirket ve tek bir zaman penceresi: Burada hiçbir şey göstermeyen bir model, başka bir ayarda hâlâ hatırlıyor olabilir. Her satır, OpenRouter'ın 24 Eylül 2026'da sunduğu modeli yansıtır ve sürümler değişir. Model başına kabaca 1.200 çiftle test, yaklaşık 0,546'lık bir birleşik AUC'yi tespit edebilir; daha küçük her şey görünmezdir.

Ön kayıt da göründüğünden daha zayıf. İlk turun donmasını çapalayan Bitcoin bloğu, o turun son çağrısından dört dakika sonra çıkarıldı; ikinci turun bloğu ise ilk çağrısından iki dakika sonrasına damgalı ve o ana kadar 14.832 isteğin 5.486'sı zaten gönderilmişti. Kanıt, protokolün o ana kadar varolduğunu gösteriyor; önce geldiğini değil. GPT-6 Astra, 3.708 çağrısının 1.464'ünden sonra kredisini tüketti ve testi yapan kişi 0,889'luk kısmi sonucu gördükten sonra tamamlandı; yani bu seçim kör değildi, ancak istekler değişmedi ve her çağrı 24 Eylül'de çalıştı. API maliyetleri ilk sekiz model için toplam 55, ikinci dört model için 73 Amerikan doları oldu; GPT-6 Astra tek başına 48, Claude Opus 5.5 ise 24 Amerikan dolar tuttu.

Neden önemli

Bir LLM ile alım satım stratejilerini backtest eden herkes için bu doğrudan bir bulaşma (contamination) uyarısı: Öne çıkan modellerden birine bir ticker ve tarih geçirin; backtestin bir kısmı, aslında ne olduğuna dair modelin hafızasıdır. Testi yapan kişinin savunmaları, görev izin verdiğinde adları ve tarihleri ayıklamak ve rakamlara güvenmeden önce kendi kurulumunuzda bir şirket içi karşılaştırma yapmak. En iyi ve en kötü performanslı modeller arasındaki fark, gürültü değil, model seçimi kararı olacak kadar geniş. Protokol, kod, tüm yanıtlar ve donma kanıtları GitHub'da yayımlandı; bilanco verileri FMP'den geliyor ve yeniden dağıtılamaz, ancak script'ler bir kullanıcının kendi API anahtarıyla onu yeniden oluşturuyor.

  • #llm
  • #model-evaluation
  • #benchmarking
  • #backtesting
  • #contamination

İlgili yazılar