· kaynak TechCrunch
a16z destekli Vals, yapay zekâ değerlendirmesini gizli ve görev tabanlı testlerle çözmek için 40 milyon dolar raised
Andreessen Horowitz liderliğinde 40 milyon dolarlık bir Series A turu alan Vals, test materyallerini gizli tutuyor ve modelleri gerçek endüstri işleri üzerinden puanlandırıyor; şirketin iddiası, değerlendirmelerin yapay zekâya olan kamu güveninin temelini oluşturacağı.

TechCrunch'ın haberine göre, 2024'te kurulan San Francisco merkezli girişim Vals, Andreessen Horowitz liderliğinde 40 milyon dolarlık bir Series A turu aldı; şirketin açık hedefi, yapay zekâ endüstrisinin değerlendirme alanındaki standart belirleyicisi olmak. Geçen ay kapanan tur, 8VC ve Bloomberg Beta liderliğindeki geçen yılki tohum turunun ardından geldi ve şirketteki hızlı büyümenin yanına denk düştü: şirket, gelirinin bir yıl öncesine göre sekiz katına çıktığını söylüyor.
Şirketin vaadi, yapay zekâ endüstrisinin büyük ölçüde kabul ettiği bir zayıflığa odaklanıyor. Benchmark'lar, laboratuvarların modellerini doğrulamanın ve rakipler üzerinde üstünlük iddia etmek için sayılar lehlerine döndüğünde bunu duyurmanın varsayılan yolu hâline geldi. Ancak bu testlerin birçoğu günümüz modellerinden daha eski ve benchmark setlerinin çoğu kamuya açık olduğu için laboratuvarlar bunların üzerinde eğitim yapabiliyor — bu da güçlü bir puanı, cevap anahtarını okuduktan sonra sınavdan yüksek alan birinin başarısı kadar anlamlı kılıyor.
Sınav kâğıtları gizli tutuluyor
Vals'ın temel yapısal farkı, test materyallerini açıklamaması ve böylece bulaşmanın en kolay yolunu kapatması. Şirket, modellerin soyut bilgiyi — bir modelin baro sınavı tarzı bir testi geçecek kadar bilgiye sahip olup olmadığını — ölçmek yerine, modellerin hukuk, finans ve yazılım geliştirme gibi alanlarda karmaşık, alanına özgü görevleri tamamlayıp tamamlayamadığını değerlendiriyor.
25 yaşındaki kurucu ortak Rayan Krishnan, daha önce Palantir'de staj yapmış ve Stanford lisans öğrencisiyken Microsoft ve üniversitenin yapay zekâ laboratuvarında çalışmıştı. TechCrunch'a, Vals'ın yeni ve son derece yetenekli modeller gelirken "akademik benchmark'ların bu sınır ilerlemesine ayak uyduramamasını" izleyerek doğduğunu söyledi. Bunun yerine yanıtlanmasını istediği soru, modellerin "her alanda insanla aynı kalitede bir ürün ortaya koyan işler yapıp yapamayacağı."
Vals yalnızca yetenekleri değil, başarısızlıkları da test ediyor. Krishnan, şirketin modeller "dünyada serbest kaldığında" "olumsuz sonuçların neler olabileceğini" analiz ettiğini söyledi. Kapsamları geleneksel endüstrilerin ötesine geçerek yinelemeli kendini geliştirme, ruh sağlığı, siber güvenlik, biyogüvenlik ve modellerin Cenevre Sözleşmesi kapsamındaki silahlı çatışma hukukunu doğru uygulayıp uygulayamayacağı gibi daha az geleneksel alanlara genişledi.
Not için ödeme yapmak
İş modeli ilk bakışta ters görünüyor: Yapay zekâ şirketleri, sonuç lehte olmayan bir puan olsa bile test edilmek için Vals'a ödeme yapıyor. Krishnan bu düzeni, bir öğrencinin SAT sınavına girmek için College Board'a ödeme yapmasına benzetiyor — ölçümün kendisi ürün, çünkü şirketlere modellerinin nerede yetersiz kaldığını ve zamanla iyileşip iyileşmediğini gösteriyor. TechCrunch'a göre bu değerlendirmeler, hangi yapay zekâ modellerini benimseyeceklerine karar veren işletmelerin kararlarında zaten önemli bir girdi hâline geliyor.
Çalışan sayısı da büyümeyi yansıtıyor. Vals yıl'a sekiz çalışanla girdi, 25 kişiye üç katına çıktı ve Krishnan'ın TechCrunch'a söylediğine göre daha büyük bir ofise taşınırken 10 ila 15 kişiyi daha işe almayı planlıyor. Şirket ayrıca federal kurumlara model değerlendirmeleri sunan bir program başlattı.
Neden önemli
Benchmark'lar satın alma kararlarını ve yapay zekâ hakkındaki kamu algısını şekillendiriyor ve mevcut sistem açıkça manipüle edilebilir. Gizli, açıklanmayan bir test seti bulaşma sorununu çözüyor ama güveni, materyalleri bağımsız olarak incelenemeyen tek bir şirkette yoğunlaştırıyor — TechCrunch'ın deyişiyle "altın standart" hâline gelen kim, fiilen endüstrinin hakemi hâline geliyor. Krishnan, resmî değerlendirmelerin endüstrinin nereye gittiğinin bu olduğuna dikkat çekiyor. Yapay zekâ şirketleri halka açık piyasalara yönelirken — SpaceX'in listelenmesini, bu yıl sonuna planlanan bir Anthropic halka arzını ve muhtemel bir OpenAI çıkışını örnek veriyor — Vals'ın geliştirdiği türde benchmark'ların model kullanımını yönlendireceğini ve "bu şirketlerin kamuoyuna açıklama dosyalarını sundukları ve hissedarlarına yapay zekâ yatırımlarını çerçeveledikleri sürecin merkezî bir parçası" hâline geleceğini bekliyor.
- #ai-benchmarks
- #evaluation
- #startups
- #venture-capital
- #ai-safety
İlgili yazılar
- Viral yapay zeka güvenliği hikayeleri inanılırlık sınıyor: zehirli internet iddiaları ve air-gap kaçış korkuları
- Donanma CTO'su yeni teknoloji öncelikleri ve ortak yatırım hamlesiyle D-F serisi startup'ları kendine çekiyor
- Trump güvenlik kaygılarını sahtekârlık olarak nitelerken, frontier AI düzenleme mücadelesi sektörü ikiye böldü