· kaynak Hacker News – Front Page (hnrss.org)
WebLLM, büyük dil modellerini tamamen tarayıcıda WebGPU hızlandırmasıyla çalıştırıyor
Hacker News'te öne çıkan WebLLM, Llama 3 ve Mistral gibi modelleri sunucu olmadan, tamamen istemci tarafında WebGPU ile çalıştırıyor ve OpenAI uyumlu bir API sunuyor.
MLC AI projesinin açık kaynak çıkarım motoru WebLLM, Hacker News'in ana sayfasında yer almasının ardından dikkat çekiyor. Kütüphane, büyük dil modellerini hiçbir backend olmadan tamamen bir web tarayıcısının içinde çalıştırıyor ve yoğun hesaplamayı kullanıcının kendi GPU'suna aktarmak için WebGPU'dan yararlanıyor.
Motor nasıl çalışıyor
Projenin GitHub deposuna göre her şey istemci tarafında yürütülüyor: sunucu bileşeni yok ve donanım hızlandırması, modern GPU hesaplama yeteneklerini tarayıcıya sunan API olan WebGPU'dan geliyor. WebLLM, model dağıtımını farklı donanım hedeflerinde taşınabilir kılmayı amaçlayan daha kapsamlı bir girişim olan MLC LLM'in bir yol arkadaşı olarak sunuluyor. Modeller MLC formatında geliyor ve depo, yapılandırılmış JSON üretiminin daha iyi performans için model kütüphanesinin bir WebAssembly bileşeni tarafından işlendiğini belirtiyor.
OpenAI uyumlu arayüz
Dikkat çeken bir tasarım tercihi API uyumluluğu. WebLLM, OpenAI chat completion API'sini sunuyor; böylece OpenAI'nin uç noktalarına yazılmış kodlar yerel açık kaynak modellere yönlendirilebiliyor. Depo, streaming, JSON modu, logit düzeyinde kontrol ve seeding'i desteklenen özellikler arasında listelerken, function calling hâlâ geliştirme aşamasında olarak işaretlenmiş. Davranışsal bir fark olarak, alışılmış model parametresi yok sayılıyor ve geliştiriciler bunun yerine motoru oluştururken ya da reload metodunu çağırarak bir model seçiyor.
Model kadrosu
Motor; Llama 3 ve Llama 2, Phi 3 serisi ve onun daha küçük öncülleri, Gemma-2B, bir dizi Mistral-7B varyantı ile 0.5B, 1.5B ve 7B parametre boyutlarında Qwen2 dahil olmak üzere birçok model ailesini yerel olarak destekliyor. Dokümandaki bir kod örneği, kuantalanmış bir Llama 3.1 8B instruct modeli kullanıyor. Farklı bir şeye ihtiyaç duyan geliştiriciler, özel modelleri MLC formatında derleyebilir ya da projenin issue takibi üzerinden yeni eklemeler talep edebilir.
Entegrasyon ve önbellekleme
WebLLM, npm, yarn veya pnpm ile kurulabilen bir paket olarak dağıtılıyor ve ayrıca doğrudan bir CDN'den import edilebiliyor; depoya göre bu, tarayıcı tabanlı kodlama platformlarında hemen kullanılabilir durumda. Sayfaların akıcı kalması için hesaplama web worker'lara veya service worker'lara devredilebiliyor ve proje, temel seviyeden ileri seviyeye Chrome uzantıları oluşturmaya dair örnekler içeriyor.
Model ağırlıklarının depolanması dört önbellek arka ucu üzerinden yapılandırılabiliyor: tarayıcı Cache API'si (varsayılan), IndexedDB, Origin Private File System ve kurulum için bir Chrome uzantısı gerektiren deneysel bir cross-origin arka ucu. Bu uzantı yoksa, WebLLM otomatik olarak varsayılan önbelleğe geri düşüyor. Doküman, ilk model indirmesinin önemli ölçüde zaman alabileceği konusunda uyarıyor; bu yüzden uygulamalar yüklemeyi uzun bir asenkron işlem olarak ele almalı. Motor, geliştiricilerin kullanıcılara indirme durumunu gösterebilmesi için bir başlatma ilerleme geri çağırımı sağlıyor.
Neden önemli
Çıkarımı cihaz üzerinde çalıştırmak, web tabanlı yapay zeka özellikleri geliştirmenin en büyük iki sürtünme noktasını ortadan kaldırıyor: geliştirici için istek başına çıkarım maliyeti ve kullanıcı için verinin cihazdan çıkması. WebLLM üzerine kurulu bir chatbot, prompt'ları ve tamamlamaları yerel tutuyor, model önbelleğe alındıktan sonra çevrimdışı çalışıyor ve işletmecisine ilk indirme dışında bant genişliği maliyeti dışında hiçbir şey Malayor.
Bu eşik teknik bir eşik aynı zamanda. Tarayıcılar uzun süre ciddi model sunumu için fazla kısıtlı kabul ediliyordu ve WebGPU hızlandırmalı bir motorun 8B sınıfı modelleri yeterli biçimde çalıştırması bu hesabı değiştiriyor. Sınırlar hâlâ gerçek — çok gigabaytlık ilk indirmeler, tarayıcılar ve cihazlar arasında düzensiz GPU desteği ve bulut API'lerinin sunduğundan daha küçük bir model kataloğu — ama istemci tarafı yapay zekanın yönünü gösteren bir sinyal olarak WebLLM, tarayıcının artık dil modelleri için meşru bir dağıtım hedefi olduğu savunuyor.
- #webgpu
- #llm
- #browser
- #on-device-ai
- #open-source
İlgili yazılar
- FineTune Studio, Qwen3-1.7B'yı yaklaşık 3,2 GB VRAM ile QLoRA üzerinden fine-tune ediyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- BrowserSkill, yapay zeka ajanlarınıza zaten oturum açtığınız tarayıcıyı kullanma imkanı veriyor