· kaynak dev.to (home feed)
Açık kaynak prototip, gecikmeli kullanıcı geri bildirimiyle Android'de 230M parametreli bir dil modelini ince ayarlıyor
dev.io üzerindeki Online-SDFT projesi, hindsight temelli self-distillation yöntemiyle 230M parametreli bir modeli Android'de sürekli ince ayarlıyor ve sentetik bildirim yönlendirme akışlarında %70,3 tercih doğruluğuna ulaşıyor.

Gemiyi indirdikten sonra da öğrenmeye devam eden bir model
dev.to üzerindeki bir yazıya göre bir ekip, küçük bir dil modelinin dağıtımdan sonra telefonda öğrenmeye devam etmesini sağlayan açık kaynak bir prototip olan Online-SDFT'yi yayınladı. Sistem, 230 milyon parametreli LiquidAI LFM2.5-230M modelini rank-4 LoRA adaptörüyle eşleştiriyor ve adaptörü cihaz üzerinde güncellemek için ONNX Runtime Training kullanıyor. Sağlama (provisioning) tamamlandıktan sonra çıkarım, etkileşim depolama, replay ve adaptör güncellemeleri tamamen yerel kalıyor; güncellemeyi hiçbir sunucu gerçekleştirmiyor.
Test ortamı Android bildirim yönlendirmesi: model bir bildirimi hemen gösterme, sonra için kaydetme veya arşivleme arasında seçim yapıyor ve ardından kullanıcının gerçekte ne yaptığından öğreniyor.
Etiket ya da ödül değil, hindsight
dev.to yazarları temel sorunu, geç gelen, özel ve belirsiz sinyallerden öğrenme olarak çerçeveliyor. Denetimli ince ayar, her bildirim için doğru bir eylem gerektirirdi; ama telefon ideal seçimi hiçbir zaman gözlemlemiyor. Pekiştirmeli öğrenme bir ödül gerektirir; oysa bir bildirimi açmak zamanlamanın doğru olduğunu kanıtlamaz ve yok saymak da önemsiz olduğunu kanıtlamaz — kullanıcı basitçe meşgul olabilir. Model ayrıca yalnızca gerçekleştirdiği eylemin sonucunu görür, karşı olguyu (counterfactual) asla görmez. Cihazın aldığı şey hindsight'dir: orijinal bağlam artı kullanıcının sonraki davranışı.
Hem öğrenci hem öğretmen olarak tek model
Online-SDFT bunu self-distillation ile çözüyor. Karar anında öğrenci — LoRA adaptörü etkin temel model — bildirimi, saati ve yerel bağlamı görür. Daha sonra aynı temel model, adaptör devre dışıyken öğretmen olarak hareket eder; özdeş bağlama gözlemlenen sonucu ekler ve üç eylem üzerinde yumuşak bir dağılım üretir. Bu dağılım, sonuçları göremeden karar vermek zorunda olan öğrenciye damıtılır. Ayrı bir öğretmen ağı yoktur.
Yöntem, sonuçları "kapatıldıysa arşivle" gibi katı kurallara dönüştürmek yerine, sonuç güvenilirliğine koşullanan yumuşak hedefler kullanıyor. Güvenilir sonuçlar bir eylemi güçlü biçimde destekler, belirsiz olanlar olası kalan eylemler arasında olasılık dağıtır ve bilgilendirici olmayan sonuçlar hiç güncelleme tetiklemez. Yazarlar, bunun eğitim döngüsünün karşı olgu uydurmasını veya her hareketi açık bir tercih olarak okumasını engellediğini söylüyor.
Canlı öğrenme için iki dengeleyici
İki ek, çevrimiçi döngüyü faydalı tutuyor. Kontrollü keşif, model belirsizken az miktarda rastgelelik enjekte eder ve güven arttıkça bunu azaltarak sistemin kendini doğrulayan davranışa kilitlenmesini önler. Sınırlı bir replay buffer, yakın geçmişin derslerden bir penceresini saklar; geri bildirim kategorileri arasında örnekleme yapar, daha yeni örnekleri tercih eder ve her zaman en yeni olanı içerir. Replay yalnızca eğitim için kullanılır ve serving prompt'unu uzatmaz.
Uyarılarla birlikte ön rakamlar
Değerlendirme, akış başına 240 karar olacak şekilde üç eşlenik sentetik bildirim akışında altı yaklaşımı kapsadı. Dondurulmuş temel model %28,2 tercih doğruluğu ve 164,7 kümülatif pişmanlık (regret) elde etti; retrieval %50,0 ve 106,6'ya; rejection fine-tuning %52,8 ve 105,3'e ulaştı. Online-SDFT %70,3 doğruluk ve 44,8 pişmanlıkla geldi ve 720 kararın 506'sında gizli örneklenmiş tercih ile eşleşti.
Rejection fine-tuning ile karşılaştırma öğretici: o taban çizgisi aynı LoRA kapasitesini kullandı ama doğrulanmış katı hedefler gerektirdi ve 311 hindsight-öğretmen adayından yalnızca 75'ini kabul etti. Online-SDFT, bir one-hot etiketi haklı çıkarmaya fazla zayıf olan dereceli sinyallerden yararlanabiliyordu. Replay da vazgeçilmez olduğunu kanıtladı — kaldırıldığında doğruluk %39,6'ya düştü ve pişmanlık 134,9'a çıktı.
Yazarlar sonuçların ön nitelikte olduğunu açıkça belirtiyor: yalnızca üç sentetik akış test edildi ve seçilen yapılandırma bağımsız bir held-out benchmark üzerinde doğrulanmak yerine aynı akışlarda ayarlandı.
Fiziksel bir telefonda çalışıyor
Depo, döngünün tamamını gerçek donanımda çalıştıran ayrı bir Android projesiyle geliyor. Dondurulmuş temel model yönlendirme kararlarını verir; bir sonuç geldiğinde ONNX Runtime Training adaptörü günceller; checkpoint'ler ve replay durumu uygulama özel depolamada yaşar ve yeniden başlatmalarda korunur. Yapılan bir fiziksel testte, bir bildirimi tekrar tekrar kapatmak modele onu sessiz tutmayı öğretti ve bildirimi yeniden istemek öğrenilen davranışı değiştirerek bir sonrakinin gösterilmesini sağladı.
Sınırlamalar da en azından açık. Bu bir üretim bildirim yöneticisi değil, mühendislik prototipi: mevcut grafik FP32 ve yüksek bellekli ARM64 cihazları hedefliyor, export ve ilk sağlama hâlâ bir Linux ana makinesi gerektiriyor ve ekip henüz gecikme, tepe bellek, pil tüketimi veya thermal throttling profillerini çıkarmadı. Android bildirim dinleyici API'leri bir bildirim gönderildikten sonra çalıştığı için demo, bir uyarı görünmeden önce garanti edilen bastırma yerine gönderim sonrası yönlendirme yapıyor.
Neden önemli
Cihaz üzerindeki küçük dil modellerinin çoğu yayınlandıkları gün dondurulur; bu da kişisel bir asistanın en çok ihtiyaç duyduğu sinyalleri tam olarak çöpe atar: kullanıcıların zamanla gerçekte nasıl tepki verdiğini. Online-SDFT, gecikmeli ve belirsiz sonuçları hindsight olarak ele alarak ve bunları temkinli biçimde damıtarak denetimli etiketler ile RL ödülleri arasında pratik bir orta yol çiziyor. Aynı yapı — eyleme geç, gecikmeli sonuçları gözle, yerel olarak güncelle — yazım önerilerine ve diğer yardımcı özelliklere de genişletilebilir; kod, Colab defteri ve Android uygulaması başkalarının denemesine açık. Sentetik akışlarda ölçülen kazanımlar gerçek kullanıcılar ve gerçek cihazlar için geçerli olacak mı? Şimdi yanıtlanması gereken soru bu.
- #on-device-ai
- #fine-tuning
- #android
- #language-models
- #open-source