· kaynak dev.to (home feed)
Caltech'ten Anandkumar ve Jenik, Transformer'lar yerine nöral operatörler üzerine Accelerated Understanding'ı kurdu
Caltech araştırmacıları Anima Anandkumar ve Benedikt Jenik, nöral operatörlere dayanan Accelerated Understanding Inc'i kurdu; bir dev.to raporuna göre şirket, tek bir test prompt'unda 5 trilyon veri noktası işledi.
Ne duyuruldu
dev.to'da yayımlanan bir yazıya göre Caltech araştırmacıları Anima Anandkumar ve Benedikt Jenik, neredeyse her sınır yapay zekâ modelinin temelindeki Transformer mimarisi yerine nöral operatörler üzerine kurulu bir girişim olan Accelerated Understanding Inc'i faaliyete geçirdi. Raporda Anandkumar'ın NVIDIA'nın yapay zekâ araştırma grubunu yönetme geçmişine dikkat çekiliyor, Jenik ise matematikçi olarak tanımlanıyor ve şirket bir modaya oynanan bir bahis değil, matematiksel özelliklere oynanan bir bahis olarak çerçeveleniyor.
Nöral operatörler Transformer'lardan nasıl farklı
Transformer'lar bilgiyi token token işler ve bir dizinin parçalarını ilişkilendirmek için attention mekanizmasını kullanır. Makalenin anlattığı gibi nöral operatörler ise sürekli uzayda çalışır ve fonksiyonlar arasındaki eşlemeleri öğrenir — bu formülasyon, diferansiyel denklemlerin ayrık semboller yerine sürekli alanları tanımladığı fiziğin diline daha yakındır.
Raporun merkezindeki argüman, bunun operatör ağlarını yapısal olarak bilimsel hesaplamaya daha uygun hale getirdiğidir. Metinle eğitilmiş bir model fiziksel olarak kavram dışı çıktılar üretebilir; dev.to yazısına göre, eğitim hedefi denklemlerin temel yapısını içeren bir ağ bu başarısızlık modunu büyük ölçüde önler, çünkü problemin matematiği cevabı kısıtlar.
Ölçek iddiası ve uyarılar
Raporun manşetindeki sayı şu: testler sırasında şirketin sistemi tek bir prompt'ta 5 trilyon veri noktası aldı. Yazar bunu, Anthropic ve Google'ın amiral gemileri Claude ve Gemini'nin aynı senaryoda bu hacmin yaklaşık milyonda birini işleyebilmesiyle karşılaştırıyor.
Bu rakamlara şüpheyle yaklaşmak gerekiyor. Tek bir blog yazısından geliyorlar, karşılaştırma senaryosu teknik ayrıntısıyla açıklanmamış durumda ve bağımsız bir benchmark'a veya metodolojiye atıf yok. Yine de yön doğruysa, bu durum bir modelin bir kerede ne kadar sürekli fiziksel veriyi özümseyebildiğinde bağlamsal uzunluktaki artıştan ziyade kategorik bir farka işaret ediyor.
Kimlere yönelik
Accelerated Understanding "kurumsal fizik yapay zekâsı" olarak pazarlanıyor. Hedeflediği problemler diferansiyel denklemler ve akışkanlar dinamiği; hedef alıcıları ise simülasyona zaten büyük paralar harcayan sektörler: petrol ve gaz, malzeme bilimi ve endüstriyel optimizasyon. dev.to makalesi, bu dikey odağın girişimi ticari olarak makul kılan şey olduğunu savunuyor — bu sektörlerin mevcut mühendislik bütçeleri var ve denklemlerini kapsamlı bir fine-tuning olmadan çözen bir sistem, yeni bir satın alma kategorisi gerektirmek yerine zaten var olan harcamalara denk düşüyor.
Neden önemli
Daha ilginç olan kısım şirketin kendisi değil, verdiği sinyal. Raporun anlattığı kadarıyla, sektörün yaklaşık son dört yıldır geçerli varsayımı, ilerlemenin Transformer'ları ölçeklendirmek anlamına geldiğiydi: daha fazla parametre, daha fazla token, daha fazla veri, rafine edilmiş attention. OpenAI, Anthropic, Google ve DeepSeek'in hepsi aynı mimariyi büyütme yarışına girdi.
Anandkumar ve Jenik'in bahsi, piyasanın bir dilimi — sofistike, fizik ağırlıklı kurumlar — için Transformer'ın hiçbir zaman doğru yapı olmadığı ve doğru hamlenin onu ölçeklendirmek değil tamamen bırakmak olduğudur. Bu, chatbot'ların yakında yerini bırakacağı iddiası değil; makale de bu yaklaşımın günlük konuşmalarda genel amaçlı asistanlarla rekabet edemeyeceğini belirtiyor.
İşaret ettiği şey ise mimari çeşitlilendirme. Nöral operatörler simülasyon ağırlıklı sektörlerde ticari olarak kanıtlanırsa, muhtemel sonuç, farklı mimarilerin farklı problem sınıflarını üstlendiği hibrit bir manzara olur ve tek bir mimarinin her görevi üstlenmesi fikri yanlış bir soyutlama gibi görünmeye başlar. Transformer hâkimiyetinin gerçekten zayıflayıp zayıflamadığı, yoksa fiziğin hiçbir zaman token tabanlı attention için uygun olup olmadığı ve sektörün bu gerçeği ancak şimdi fark edip etmediği hâlâ açık bir soru — raporun ifadesiyle, fizik topluluğunun yakından izleyeceği bir soru.
- #ai
- #neural-operators
- #transformers
- #caltech
- #research
İlgili yazılar
- Eski LinkedIn SRE'si, yapay zekâ ile olay yönetiminin mühendislerin sistem bilgisünü aşındırdığı konusunda uyarıyor
- SWE-Bench ProMax: en iyi model büyük çok dilli refactoring görevlerinin yalnızca yüzde 41,2'sini çözebiliyor
- Robotik veri girişimi XDOF, stealth'ten çıkışından üç ay sonra 1,2 milyar dolarlık Series B için görüşüyor