deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

G-CARL, RLHF ödüllerini tıbbi yapay zeka ajanları için doğruluk, kapsam ve ifade bileşenlerine ayırıyor

dev.to'da yayımlanan bir yazı, G-CARL adlı ödül öğrenme yöntemini tanımlıyor: tıbbi yapay zeka yanıtları bağımsız şekilde doğrulanmış gerçeklik, sorgudan türetilen kontrol listesi kapsamı ve ifade üzerinden puanlanıyor, ardından ajanlar PPO ile ince ayarlanıyor.

G-CARL, RLHF ödüllerini tıbbi yapay zeka ajanları için doğruluk, kapsam ve ifade bileşenlerine ayırıyor

G-CARL'ın hedeflediği sorun

Geleneksel RLHF, kaliteyi tek bir bütünsel tercih sinyaline indirger. dev.to'da yayımlanan bir yazıya göre bu durum, bir ajanın radyoloji bulgularını hastalara açıkladığı, hasta yönelimli tıbbi rapor yorumlama (PMRI) alanında sorun yaratıyor; çünkü burada birbirinin tersi yönlerde çeken iki kısıtlama söz konusu. Kanıt temellilik, her tıbbi iddianın radyoloji raporuna veya klinik bilgi tabanına geriye doğru izlenebilir olmasını gerektirir. Hastaya uygunluk ise ifadenin, derinliğin ve vurgunun bireysel sorguya ve şu ana kadarki diyaloga uyum sağlamasını gerektirir.

Yazı, bu hedeflerin naif optimizasyon altında çatıştığını savunuyor: yardımseverlik için ödüllendirilen bir model, kulağa mantıklı gelen ayrıntılar uydurmaya eğilimliyken, desteklenmeyen her ifade için sert şekilde cezalandırılan bir model neredeyse hiçbir şey açıklamayı reddedebilir. Grounded Checklist-Aligned Reward Learning'in kısaltması olan G-CARL, sorunu ikiye bölerek yanıt veriyor: her bir iddianın tek tek doğru olup olmadığı ve yanıtın hastanın sorduğu şeyi gerçekten ele alıp almadığı. İkisi de ayrı ayrı zorunlu kılınıyor.

İddia düzeyinde temellendirme

Temellendirme hattı önce ajanın yanıtını ayrık tıbbi ifadelere ayrıştırıyor. Her iddia üç kaynakla paralel olarak karşılaştırılıyor: kesin bulgular için özgün radyoloji raporu, genel klinik gerçekler için tıbbi bilgi tabanı ve hastaya özgü geçmiş için önceki diyalog. Her iddiaya, bu kaynakların herhangi birinde destekleyici kanıt bulunup bulunmamasına bağlı olarak ikili (temellendirilmiş ya da temellendirilmemiş) bir etiket atanıyor.

dev.to yazısı, bunun anlamsal benzerlik araması olmadığını vurguluyor. Test, bir iddianın tıbbi olarak makul görünmesi değil, mevcut kanıtla gerekçelendirilip gerekçelendirilemediğidir.

Kontrol listesi hizalı kapsam

İkinci bileşen uygunluğu ele alıyor. Her hasta sorgusu için sistem, gerekli konulardan oluşan bir kontrol listesi türetiyor; örneğin bir akciğer nodülünü açıklamak, önceki bir taramayla karşılaştırmak veya sonraki adımları özetlemek. Yanıt, kontrol listesindeki kaç öğeyi kapsadığına göre puanlanıyor. Kontrol listesi ağırlıkları örnek başına uyarlanıyor; böylece bir hasta özellikle bir nodül hakkında sorarsa, bu öğe genel rapor yapısından daha fazla puan değerindedir.

Üç parçalı bileşik ödül

G-CARL'ın ödül modeli üç bileşeni birleştiriyor. Doğruluk, geri getirim tabanlı ikili etiketler kullanılarak iddia düzeyinde kesinlik olarak ölçülüyor. Kapsam, sorgudan türetilen kontrol listesine karşı kontrol listesi geri çağrısı (recall) olarak ölçülüyor. İfade, okunabilirlik ve ton için hafif bir dil modeli tarafından puanlanıyor. Nihai ödül, üçünün ağırlıklı toplamı; ağırlıklar bir doğrulama kümesi üzerinde hiperparametre olarak ayarlanıyor.

Yazıya göre temel tasarım noktası, doğruluk ve kapsamın bağımsız olarak doğrulanması; böylece model bir metriği diğerini feda ederek dolambaçlı yoldan geçemiyor.

Eğitim ve çıkarım

Eğitim hattı üç aşamada çalışıyor. Denetimli ısınma başlangıcı (warm-start), bir görüntü-dil modelini klinisyenlerin yazdığı yorumlar üzerinde ince ayarlıyor. Ödül modelinin kendisi, yani doğruluk doğrulayıcısı ve kontrol listesi üreteci, etiketli örnekler üzerinde eğitiliyor. Son olarak, pekiştirmeli öğrenme, ajanı bileşik ödülü kullanarak proximal policy optimization ile ince ayarlıyor ve denetimli politakaya karşı KL-divergence cezasıyla düzenliyor. Bu ceza, temellendirilmemiş iddialardan kaçınmak için yanıtlamayı reddetme gibi yozlaşmış stratejilere karşı bir koruma olarak tanımlanıyor.

Çıkarım sırasında ajan isteğe bağlı olarak kendi kendini doğrulayabiliyor: iddiaları çıkarmak, temellendirmelerini kontrol etmek ve doğruluk puanı bir eşiğin altına düştüğünde yanıtı yeniden üretmek. Yazı, bunun gecikme eklediğini belirtip üretim ortamları için iddia doğrulamanın toplu yapılmasını ve bilgi tabanı sorgularının önbelleğe alınmasını öneriyor.

Değerlendirme ve başarısızlık modları

Bildirilen değerlendirme üç boyutlu: doğruluk için klinisyen etiketli iddia kesinliği, kapsam için kontrol listesi geri çağrısı ve ifade için okunabilirlik ile uygunluk puanları. dev.to yazısına göre, klinisyenler tarafından yapılan ikili tercih değerlendirmesi, G-CARL çıktılarını temel RLHF'den ya da yalnızca denetimli ince ayardan daha doğru ve hasta ihtiyaçlarıyla daha iyi hizalanmış buldu.

Yöntem halüsinasyonu ortadan kaldırmıyor; doğruluğu denetlenebilir kılıyor ve temellendirilmemiş iddiaları cezalandırıyor. Yazı, bazılarının makaleden belgelenmek yerine mimariden çıkarıldığını belirttiği başarısızlık modlarını listeliyor. Geri getirim boşlukları, modeli bilgi tabanında yer almayan nadir durumları açıklama yeteneksiz bırakabilir. Kontrol listesi kayması, kontrol listesi üreteci hastanın niyetini yanlış okuduğunda ortaya çıkar ve optimizasyonu yanlış hedefe yönlendirir. Adversarial akıcılık, modelin ikili temellendirme cezalarından kaçınmak için temkinli ifadeler öğrenmesi anlamına gelir. Önerilen gözlemlenebilirlik önlemleri arasında iddia düzeyinde temellendirme kararlarının günlüğe kaydedilmesi, sorgu başına kontrol listesi kapsamının izlenmesi ve reward hacking'i saptamak için denetimli politikadan KL-divergence'ın izlenmesi yer alıyor.

Neden önemli

Acil uygulama alanı darsa da örüntü öyle değil. Bir doğruluk kaynağının bulunduğu ve bağlama bağımlı iletişimin gerektiği her ajan alanı aynı ayrımı benimseyebilir: iddialarını içtihat ve yasalara temellendiren hukuk ajanları, mevzuat kısıtlarına ve piyasa verilerine göre doğrulanan finansal tavsiye ya da kontrol kararlarını sensör verilerine ve güvenlik kurallarına geriye doğru izleyen güvenlik kritik otomasyon.

RLHF uygulayıcıları için daha geniş ders, ayrıştırmadır. Tek bir bütünsel tercih sinyalini ayrı ayrı doğrulanabilir bileşenlerle değiştirmek, reward hacking'i zorlaştırır ve doğruluğu denetlenebilir kılar; buna karşılık geri getirim, kontrol listesi üretimi ve çıkarım zamanı gecikmesinde gerçek bir mühendislik yükü getirir. Halüsinasyonun gerçek dünyada sonuçları olduğu ve yapılandırılmış kanıt kaynaklarının bulunduğu durumlara uygundur; bunların bulunmadığı durumlara ise uygun değildir.

  • #medical-ai
  • #rlhf
  • #reward-model
  • #hallucination
  • #reinforcement-learning