· kaynak dev.to (home feed)
İlaç etkileşim kontrolcüsü, WebGPU ve WebLLM ile LLM'i tamamen tarayıcıda çalıştırıyor
Bir dev.to eğitimi, LLM'in WebGPU ve WebLLM aracılığıyla kullanıcının GPU'sunda çalıştığı bir ilaç etkileşim kontrolcüsünü anlatıyor; böylece hiçbir medikal sorgu cihazdan çıkmıyor.

Sunucusuz bir ilaç kontrolcüsü
dev.to üzerinde beck_moulton tarafından yazılan bir eğitim, büyük bir dil modelini tamamen tarayıcıda çalıştıran bir ilaç etkileşim kontrolcüsünün nasıl kurulacağını ayrıntılarıyla anlatıyor. Stack React 18+, TypeScript ve Vite'dan oluşuyor; model yürütmeyi ise @mlc-ai/web-llm kütüphanesi üstleniyor. Uygulama, barındırılmış bir inference API'sini çağırmak yerine quantize edilmiş bir Llama-3 8B Instruct modeli yüklüyor ve WebGPU üzerinden kullanıcının kendi GPU'sunda çalıştırıyor. Gönderiye göre ilaç sorguları hiçbir zaman cihazdan çıkmıyor — bunları alacak bir backend yok ve ihlal edilebilecek bir istek kaydı da yok.
Yerel pipeline nasıl çalışıyor
Eğitimdeki veri akışı her şeyi tek bir gizlilik sınırı içinde tutuyor: React state bir WebLLM engine örneğini besliyor, engine işleri WebGPU API'sine iletiyor ve cihazın GPU'su üretilen token'ları akış halinde arayüze geri gönderiyor. Gönderide açıklandığı üzere WebGPU, tarayıcıya yerel grafik kartına doğrudan ve düşük seviyeli erişim sağlıyor; eskiden sunucu sınıfı GPU'lara sahip bir Python backend'in varsayılan olduğu bu senaryoda, tarayıcı içi LLM yürütmeyi mümkün kılan da bu.
Model yüklemesi başlıca sürtünme noktası. Ağırlıklar yaklaşık 2GB ile 5GB arasında yer tuttuğundan eğitim, engine başlatmasını bir React hook içinde sarmalıyor ve indirme ilerlemesini yüzde olarak gösteriyor. İlk çalıştırmadan sonra ağırlıklar IndexedDB'de önbelleğe alınıyor, böylece geri dönen kullanıcılar indirmeyi atlıyor.
Etkileşim mantığı bir prompt
Anlatıldığı haliyle yapıda bir etkileşim veritabanı yok. Araç modele, kendisini klinik eczacılık uzmanı gibi davranması ve sabit bir yapıda yanıt vermesi talimatını veren bir system prompt gönderiyor: etkileşim şiddeti derecelendirmesi (hafif, orta veya şiddetli), etkileşimin arkasındaki mekanizma ve bir öneri. Model bir etkileşim bulamazsa bunu söylemesi isteniyor. Yanıtlar arayüze token token akıyor.
Yazarın öne sürdüğü takaslar
Gönderi bu yaklaşım için üç argüman sıralıyor. Gecikme konusunda, model önbelleğe alındığında ilk token'a kadar geçen sürenin OpenAI sunucularına yapılan bir gidiş-dönüşü geçebileceğini iddia ediyor. Maliyet konusunda, kullanıcının donanımı hesaplamayı sağladığı için işletici inference için hiçbir şey ödemiyor. Güvenlik konusunda yazar, tasarımın hiçbir sunucu tarafı kayıt bulunmaması nedeniyle HIPAA gibi sağlık verisi kurallarına doğal olarak uygun olduğunu savunuyor.
Bunlar bağımsız olarak ölçümlenmiş sonuçlar değil, yazarın iddiaları — gönderide yayınlanmış herhangi bir ölçüm yok ve resmî HIPAA uyumluluğu, yazılım mimarisinden fazlasını içeren düzenleyici bir karardır.
Eğitimin kendisinin işaret ettiği uyarılar
Gönderi, bu yapının bir proof of concept olduğunu açıkça belirtiyor. Üretim kullanımı için çözülmemiş işlere dikkat çekiyor: VRAM'i dikkatli yönetmek, model önbelleğini düzgün ele almak ve modelin parametrik hafızasına değil güncel tıbbi kaynaklara dayanması için üzerine retrieval-augmented generation katmanı eklemek. Önerilen sonraki adımlar arasında, FDA dokümantasyonunu cihaz üzerinde aramak için yerel bir vector store olan Voy'u bağlamak ve daha basit sorguları daha küçük modellere yönlendiren bir mantık eklemek yer alıyor. Donanım da bir kısıt: araç WebGPU destekli bir GPU ile güncel bir Chrome, Edge veya Arc tarayıcısı ve çok gigabaytlık ilk indirme için bant genişliği gerektiriyor.
Daha temel sınırlama ise doğruluk. Arama katmanı olmadan yalnızca bir prompt'tan yanıt veren 8B parametreli bir model, kendinden emin hatalar üretebilir — bu da farmakoloji bağlamında ciddi bir risk. Eğitimin üretime hazır her şeyden önce retrieval eklenmesi konusundaki ısrarı, bu açığın fiilen bir ikrarıdır.
Neden önemli
Proje, tarayıcı içi yapay zekânın ne kadar ilerlediğine dair yararlı bir gösterge. Birkaç yıl önce bir LLM çalıştırmak bir sunucu anlamına geliyordu; bugün quantize edilmiş bir 8B model, WebGPU'nun hesaplamayı sağlaması ve IndexedDB'nin model önbellezi olarak davranmasıyla tüketici donanımında bir tarayıcı sekmesinde yürütülebiliyor. Sağlık, hukuk ve finans gibi hassas alanlar için ilgi çekici özellik mimaridir: gizlilik, bir sağlayıcının verilerinizle ne yaptığı konusunda bir politika olmaktan çıkıp verinin fiziksel olarak nerede bulunduğuna dair bir gerçeğe dönüşüyor. Bu özel araç bir demo olsa da tıbbi yazılım olmasa bile, gösterdiği desen — yerel model, yapılandırılmış prompt, isteğe bağlı cihaz içi retrieval — üretim uygulamalarının doğrulanmış veri kaynakları takas ederek ödünç alabileceği bir desendir.
- #webgpu
- #web-llm
- #on-device-ai
- #privacy
- #browser