· kaynak Hacker News – Front Page (native)
Stanford ekibi yerel yapay zeka verimliliği için watt başına zekâ metriği öneriyor
Stanford öncülüğünde hazırlanan bir makale, 20'den fazla yerel LLM'yi 8 hızlandırıcı ve 1 milyon gerçek sorgu üzerinden değerlendirerek yerel çıkarım verimliliğinin birleşik bir ölçüsü olarak watt başına zekâyı (IPW) öneriyor.

Stanford öncülüğündeki bir araştırma ekibi, bir yapay zeka iş yükünün veri merkezinde değil dizüstü bilgisayarda çalıştırılması gerekip gerekmediğine karar vermek için tek bir sayı önerdi: tüketilen güç birimi başına görev doğruluğu olarak tanımlanan watt başına zekâ, yani IPW. Hacker News'in ana sayfasında öne çıkmasının ardından arXiv'de yayımlanan makale, yerel çıkarımın merkezi bulut altyapısındaki talebin anlamlı bir bölümünü üstlenebilecek kadar geliştiğini ve bu geçişi izlemek için izlenecek metriğin IPW olduğunu savunuyor. Yazar listesinde John Hennessy ve Christopher Ré de yer alıyor.
Makalenin çıkış noktası
Özete göre, büyük dil modellerine yapılan sorguların çoğu şu anda merkezi bulut altyapısında çalışan frontier modeller tarafından işleniyor ve talep, sağlayıcıların bu kapasiteyi ölçeklendirme hızından daha hızlı büyüyor. Yakın zamandaki iki gelişme bu düzeni yeniden düşünmek için bir fırsat yaratıyor: küçük yerel modeller — makale 20B veya daha az aktif parametreye odaklanıyor — artık birçok görevde frontier modellerle rekabetçi performans sergiliyor ve Apple'ın M4 Max'i gibi yerel hızlandırıcılar bu modelleri etkileşimli gecikme süreleriyle çalıştırabiliyor.
Bu durum çalışmanın merkezî sorusunu gündeme getiriyor: yerel çıkarım, talebi merkezi altyapıdan uygulanabilir biçimde yeniden dağıtabilir mi? Bunu yanıtlamak aynı anda iki şeyi ölçmeyi gerektiriyor — yerel modellerin gerçek sorguları doğru yanıtlayıp yanıtlamadığı ve dizüstü bilgisayarlar gibi güç kısıtlı cihazlarda bunu verimli biçimde yapıp yapmadığı. IPW yazarların cevabı: hem yetenek hem de verimliliği model ve hızlandırıcı kombinasyonları genelinde kapsayan tek bir birleşik metrik.
Değerlendirme nasıl yapıldı
Çalışma, 20'den fazla son teknoloji yerel LM'yi, yerel ve bulutu kapsayan 8 donanım hızlandırıcıyı ve gerçek dünyadan 1 milyon tek turlu sohbet ve akıl yürütme sorgusunu kapsıyor. Ekip her sorgu için doğruluğu — yerel modelin frontier modellere karşı kazanma oranı olarak ifade ediliyor — enerji, gecikme ve güç ölçümleriyle birlikte ölçtü.
Çalışmanın bulguları
Üç sonuç öne çıkıyor. Yerel LM'ler sorguların yüzde 88,7'sini başarıyla yanıtladı; doğruluk alana göre değişiklik gösterdi. 2023'ten 2025'e uzanan boylamsal bir analiz, IPW'nin 5,3 kat iyileştiğini gösteriyor; yazarlar bunu algoritmik ve hızlandırıcı ilerlemelerinin bir bileşimine bağlıyor. Aynı dönemde yerel olarak karşılanabilen sorgu kapsamı yüzde 23,2'den yüzde 71,3'e yükseldi. Aynı modeller her iki donanım sınıfında da çalıştırıldığında ise yerel hızlandırıcılar, bulut hızlandırıcılardan en az 1,4 kat daha düşük IPW değerine ulaştı — yazarların, dizüstü sınıfı çiplerin watt başına verimlilikte hâlâ veri merkezi silikonlarının gerisinde olması nedeniyle yerel hızlandırıcı optimizasyonu için önemli bir potansiyel olarak sunduğu bir fark.
Bazı uyarılara dikkat etmek gerekiyor. Çalışma bir ön baskı; ilk kez Kasım 2025'te yayımlandı ve o zamandan beri defalarca revize edildi, en son Eylül 2026'da. Ayrıca doğruluk, frontier modellere karşı bir kazanma oranı olarak tanımlandığından, yerel yetenek hareketli bir hedefe göre ölçülüyor.
Neden önemli
Güç kısıtları altında yerel yapay zeka çalıştıran herkes için — dizüstü bilgisayarlar, uç cihazlar, pil ile çalışan veya dar bir ısıl bütçesi olan her şey — IPW, kamusal tartışmanın genellikle model sıralamaları ve ham saniye başına token sayısında kaldığı yerde ortak bir ölçü sunuyor. Bir dağıtımı asıl belirleyen iki soruyu tek bir sayıda birleştiriyor: model görev için yeterince doğru mu ve donanım onu güç aralığı içinde sürdürebiliyor mu?
Bulgular ayrıca bir yönlendirme argümanı çiziyor. Yerel modeller bu değerlendirmede gerçek dünyadaki sorguların yüzde 88,7'sini başarıyla ele aldıysa, trafiğin önemli bir alt kümesinin frontier-bulut gidiş gelişine kesin bir ihtiyacı yok — bu da tam olarak makalenin öngördüğü talep yeniden dağılımı ve beraberinde gelen enerji ve ölçeklendirme baskısı. Bu arada 1,4 katlık verimlilik farkı, çip üreticileri için bir kıstas işlevi de görüyor: yerel hızlandırıcıların, yerel öncelikli senaryonun savunulmasını kolaylaştırmak için ne kadar yol kat etmesi gerektiğini sayısallaştırıyor.
- #local-ai
- #llm
- #benchmark
- #energy-efficiency
- #edge-computing