deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Gimlet Labs, yapay zeka inference'ı ölçeklendirmek için Andreessen Horowitz liderliğinde 300 milyon dolarlık Series B turu aldı

Gimlet Labs, Andreessen Horowitz liderliğinde 300 milyon dolarlık bir Series B turu aldı; şirket, modelleri farklı hızlandırıcı türleri arasında ayrıştırarak watt başına 5-10 kat hız kazanımı sağlayan çok silikonlu bir inference bulutu kurduğunu iddia ediyor.

Gimlet Labs, yapay zeka inference'ı ölçeklendirmek için Andreessen Horowitz liderliğinde 300 milyon dolarlık Series B turu aldı

Gimlet Labs, Andreessen Horowitz liderliğinde 300 milyon dolarlık bir Series B turu aldı; yanında Sapphire Ventures, Menlo Ventures, 645 Ventures, Arm, Eclipse, Emergence, Factory, Hudson River Trading, M12, OnePrime Capital, Prosperity7, QuantumLight, Samsung Ventures, Tiger Global Management, Triatomic, Wing Ventures ve XTX Markets'ın da bulunduğu geniş bir yatırımcı grubu yer aldı. Şirket, turu Hacker News ana sayfasına çıkan bir blog yazısında duyurdu.

Bu tur, Gimlet'in Series A turunun üzerinden geçen beş ayın hemen ardından geldi. Şirketen gelen bilgilere göre Mart'tan bu yana milyarlarca dolarlık sözleşmeli gelir eklendi, gigawatt cinsinden ölçülen bir veri merkezi hattı oluşturuldu ve yönetilen kapasite hızla yüzlerce megawatt'a doğru ölçekleniyor.

Gimlet'in saldırdığı sorun

Gimlet'e göre aylık token üretimi son on iki ayda altı kat büyüdü ve bazı tahminler 2030'a kadar yirmi kat daha fazla artış öngörüyor. Bu büyümenin altını dolduran, şirketin yılda yaklaşık 1 trilyon dolara ulaştığını söylediği ve 2030'a kadar kümülatif 7 trilyon dolar beklenen bir sektör yatırım programı.

Güç, belirleyici kısıt. Gimlet, 2025'te yapay zeka veri merkezlerindeki tüketimin yaklaşık 18 GW olduğunu ve bu rakamın 2030'a kadar üçe katlanmasının beklendiğini, bunun da yeni üretim, şebeke kapasitesi ve sayaç arkası enerji üretimi gerektirdiğini belirtiyor. Bu kaynaklar eninde sonunda teslimat sınırlarına takılacağı için, şirket sektörün ölçeklenmeye devam etme yolunun kilowatt başına verimi en üst düzeye çıkarmak olduğunu savunuyor.

Bir de gecikme boyutu var. Agent tabanlı iş yükleri, onlarca sıralı model çağrısından oluşan çok adımlı inference döngüleri çalıştırıyor; bu nedenle gecikme adımlar boyunca birikiyor. Model boyutları birkaç yıl önceki birkaç yüz milyar parametreden bugün 3-10 trilyona büyüdü ve bağlam pencereleri 2023'te yaklaşık 100K tokenden bir milyona veya daha fazlasına genişledi.

Gimlet'in temel teşhisi, inference'ın büyük ölçüde eğitim kümelerinden dönüştürülmüş homojen altyapıda sunulduğu ve bunun yüksek verim ile düşük etkileşimlilik arasında bir seçim yapmayı dayattığı yönünde. Şirket, inference'ın eğitim'den temelden farklı olduğunu ve altyapının en baştan inference göz önünde bulundurularak yeniden inşa edilmesi gerektiğini savunuyor.

Çok silikonlu bir inference bulutu

Gimlet, kendisini baştan sona inference performansı için sıfırdan tasarlanan ilk "çok silikonlu bulutu" kuruyor olarak tanımlıyor. Platform heterojen donanım üzerinde çalışıyor — GPU'lar, bellek yakını hesaplama, dataflow mimarileri ve CPU'lar — ve yazılım yığını modelleri ayrıştırarak inference iş yükünün her aşamasını ona en uygun silikon mimarisine zamanlıyor.

Şirket, modelleri bu şekilde parçalamanın aynı güç ayak iziyle 5-10 kat hız kazandırdığını, aynı gecikmede benzer verim iyileştirmeleri sağladığını ve geleneksel homojen altyapıya kıyasla sınır iş yüklerinde 3-10 kat daha hızlı performans sunduğunu iddia ediyor.

Yazı, farklı ödünleşimlere sahip birkaç ayrıştırma şeması özetliyor. Prefill/decode, hesaplama yoğun prefill aşamasını bellek bant genişliği yoğun decode aşamasından ayırıyor ve en düşük gecikmeyi sunuyor. Speculative-decode ayrıştırması ve attention-FFN ayrıştırması, homojen dağıtımlara göre daha yüksek verimle hız kazancı sağlıyor. Gimlet, modellerin izlendiğini ve ayrıştırıldığını, ardından iş yükü SLA'larına ve kullanılabilir donanıma göre zamanlandığını; hesaplamanın boşta kalmaması için dinamik yeniden dengeleme yapıldığını söylüyor: Bir donanım türü decode için tamamen kullanılıyorsa ve talep artıyorsa, decode instance'ları diğer kullanılabilir donanımda başlatılabiliyor. Şirket, gelecekteki teknik yazılarda ayrıntılandıracağı yeni ayrıştırma türleri üzerinde çalıştığını belirtiyor.

Gimlet şu anda sınır laboratuvarlarıyla ve inference'ın diğer büyük ölçekli tüketicileriyle çalıştığını ve daha geniş bir kitleye ulaşmak için kapasiteyi artırdığını söylüyor. Ayrıca sistemler, veri merkezleri, derleyiciler, dağıtık sistemler, ağ ve performans mühendisliği alanlarında işe alım yapıyor.

Neden önemli

Bu, özellikle sınır modelleri veya eğitim hesaplaması yerine inference altyapısına yapılmış daha büyük girişim yatırımlarından biri. Token talebi Gimlet'in öngördüğü şekilde büyür ve güç darboğaz olmaya devam ederse, watt başına verim belirleyici rekabet ekseni haline gelir — ve Gimlet'in heterojen silikon artı ince taneli ayrıştırmanın mertebesinde kazanımlar açığa çıkarabileceği iddiası, dönüştürülmüş eğitim altyapısı üzerine kurulu yerleşik GPU bulutlarına doğrudan bir meydan okuma.

Bildirilen çekiş — Series A'nın hemen ardından aylar içinde milyarlarca dolarlık sözleşmeli gelir — sınır laboratuvarlarının şimdiden inference alternatifleri aradığına işaret ediyor. Açık sorular şunlar: Ayrıştırılmış çok silikonlu zamanlamanın yüzlerce megawatt ölçeğinde güvenilir biçimde teslim edilip edilemeyeceği ve performans iddialarının, homojen yığınlar gelişmeye devam ederken geçerli kalıp kalmayacağı. Andreessen Horowitz ve ortak yatırımcılarından gelen 300 milyon dolar, kalacağına dair bir bahis.

  • #ai
  • #inference
  • #startups
  • #venture-capital
  • #datacenters
  • #hardware

İlgili yazılar