deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Glasshouse v0.1, Yapay Zeka Sistemlerinde Uzun Vadeli Bellek için Açık bir Benchmark Başlattı

Glasshouse v0.1, yapay zekanın uzun vadeli belleğini 10 dilde 1,97 milyon tokenlık bir konuşma boyunca test ediyor; hatırlama, eski bilgiler, çelişkiler ve yanlış anı sondalarını ayrı eksenlerde puanlandırıyor.

Glasshouse v0.1, Yapay Zeka Sistemlerinde Uzun Vadeli Bellek için Açık bir Benchmark Başlattı

Ne yayınlandı

Bir geliştirici, yapay zeka sistemlerinde uzun vadeli belleği ölçmek için açık bir benchmark olan Glasshouse v0.1'i yayınladı. dev.to üzerindeki bir gönderiyle duyurulan proje, yazarın platformda daha önce yayınladığı benchmark yazıları üzerine inşa ediliyor; kod, veri ve talimatlar GitHub'da wontopos/glasshouse adresinde barındırılıyor.

Yazara göre motivasyon, geliştirici topluluklarındaki tekrarlanan şikayetlerden geldi: satıcıların yayınladığı bellek rakamları nadiren başkalarının ölçtüğüyle örtüşüyor ve sonuçları değerlendirmek için kullanılan modeli değiştirmek, karşılaştırılan sistemler arasındaki gerçek farktan daha fazla puanları oynatıyor. Glasshouse, bu belirsizliğin yerine geçecek ortak bir ölçü olarak konumlandırılıyor.

Benchmark ne içeriyor

v0.1 sürümü, 10 dili kapsayan ve 50 fotoğraf içeren, 1,97 milyon tokena uzanan bir konuşmaya 2.847 soru yerleştiriyor.

Konuşma, 1.882 turdan 103.572 tura kadar dört farklı boyutta sunuluyor ve cevapları barındıran bölüm hepsinde aynı. Değişen şey, bu cevapların etrafında biriken geçmişin miktarı. Bu yapının kendisi ana fikir: bir sistemin puanının nerede çöktüğü, soruların zorlaşıp zorlaşmadığını değil, sistemin geçmiş büyüdükçe yozlaşıp yozlaşmadığını gösteriyor.

Puanlar her eksen için ayrı ayrı raporlanıyor; tek bir ana rakam yok. Yazarın gerekçesi şöyle: bir sistem bir eksende güçlü, bir diğerinde işe yaramaz olabilir ve toplu bir rakam, tam da önemli olan bu ayrımı bulanıklaştırır.

Hatırlamadan fazlasını değerlendirmek

Birkaç eksen, dev.to gönderisinde anlatıldığı üzere, depolanmış bilgileri geri getirmenin ötesindeki davranışları test ediyor:

  • Eski bilgiler: konuşma sırasında bir değer değiştiğinde ve sistem yeni değeri bulamadığında, "bilmiyorum" demek eski değere güvenle tekrar etmekten daha iyi puan alıyor.
  • Çelişkiler: depolanmış iki bilgi çeliştiğinde ve çatışmayı çözen bir şey yokken, uyuşmazlığı raporlamak doğru cevaptır; sessizce birini seçmek yanlış sayılır.
  • Yanlış anı sondaları: cevap hiç verilmediğinde, benchmark sistemin bunu söyleyip söylemediğini kontrol eder.

Yazar ayrıca bazı rakamların önceki bir gönderiden bu yana değiştiğini ve önceki gönderinin bunu olacağını zaten söylediğini belirtiyor.

Bilinçli olarak boş bir gönderi klasörü

Projenin gönderi dizini şu anda boş ve yazar da bir sonuç göndermemiş. Bireylerden benchmark'ı çalıştırmaları ve bir şeyler yanlış göründüğünde bir pull request ya da bir issue açmaları isteniyor. Bilinçli olarak bireyler için hiçbir katılım eşiği yok ve belirli bir hatayı adıyla veren bir itiraz alenen yanıtlanıyor.

Tasarım, geliştirme sırasında dışarıdan gelen geri bildirimle şekillendi. Depodaki bir dosya, v0.1 inşa edilirken Reddit'te toplanan önerileri ve her birinin neye dönüştüğünü listeliyor: eski bilgi ekseni, çelişki ekseni ve yanlış anı sondalarının hepsi yorum olarak başladı. Kullanılmayan bir öneri de, yine listeleniyor; gerekçe olarak yalnızca kabul edilenleri gösteren bir kaydın doğrulanamayacağı gösteriliyor. Şirketler, depoda belgelenen bir süreçle sonuç gönderebilir veya kendilerini ekleyebilir.

Neden önemli

Uzun vadeli bellek, giderek daha fazla geniş geçmişler boyunca çalışan yapay zeka ajanları ve asistanlarının yük taşıyan bir bileşeni haline geliyor. Bu alandaki karşılaştırmalar güvenilmez olageldi; dev.to gönderisi, tekrarlanamayan satıcı rakamlarından ve ölçülen farkları gölgede bırakan derecelendirici modellerden söz ediyor. Konuşmanın cevapları taşıyan bölümünü sabit tutup yalnızca çevresindeki geçmişi değiştirerek Glasshouse, biriken bağlam altındaki yozlaşmayı yalıtıyor; uzun süre çalışan sistemlerin tam da bu başarısızlık biçimiyle karşılaştığı nokta bu.

Her ekseni ayrı puanlama ve kendinden emin hataya dürüst belirsizliği tercih etme seçimi, değerlendirmeyi çıplak hatırlamadan ziyade davranışa doğru itiyor. Ve boş skor tablosu da teklifin bir parçası: önce incelemeyi davet ederek, hem kabul edilen hem reddedilen önerilerin kamuya açık bir kaydını yayınlayarak ve adıyla belirtilen hataları açıkça yanıtlayarak proje, kimse puan yayınlamadan önce benchmark'ın kendisine güven inşa etmeye çalışıyor. Gönderilerin gelip gelmeyeceği, bunun yaygın bir referans noktası olup olmayacağını belirleyecek; her durumda açık metodoloji, herkesin ona karşı test yapmasına izin veriyor.

  • #benchmarks
  • #long-term-memory
  • #llm
  • #open-source
  • #evaluation

İlgili yazılar