deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Sürekli difüzyon dil modelleri, 2023'teki yok oluşun ardından geri dönüyor

Sürekli difüzyon dil modelleri üzerine araştırmalar, bu yaklaşımın 2023 sonunda terk edilmesinin ardından yeniden canlanıyor; bu dönüşümü araştırmacı Sander Dieleman'ın yeni bir retrospektifi ele alıyor.

Sürekli difüzyon dil modelleri, 2023'teki yok oluşun ardından geri dönüyor

Sürekli difüzyon dil modelleri üzerine yeni bir araştırma dalgası sürüyor ve bu durum, 2023 sonunda başlayan neredeyse tamamen durgunluk dönemini sona erdiriyor. Bu, Imagen, Veo ve Nano Banana dahil görüntü ve video üretim sistemleri üzerinde çalışmış bir araştırmacı olan Sander Dieleman'ın retrospektifinin temel iddiası; Dieleman'ın Hacker News ana sayfasına ulaşan yazısı, alanın sürekli yöntemlerden uzaklaşmasının yeniden gözden geçirilmeyi hak eden bir hata olabileceğini savunuyor.

Otoregresyonun uzun gölgesi

Neredeyse her modern dil modeli otoregresiftir: metni bir seferde bir token üretir ve her adım, önceki her şeye koşulludur. Dieleman'ın açıkladığı gibi, bu, zor bir üretim görevini birçok küçük ve özdeş tahmin adımına böler; bu da dizi boyunca parametre paylaşımını mümkün kılar ve — teacher forcing sayesinde — Transformer'ların tüm konumlarda paralel olarak eğitilmesini sağlar. Bu birleşim istisnai ölçüde ölçeklenebilir olduğunu kanıtladı ve LLM çağını yarattı.

Difüzyon farklı bir türdeki yinelemeli süreç sunar. Bir model, bir sonraki elemanı tahmin etmek yerine, bozulma prosedürünü tersine çevirmeyi öğrenir; klasik yöntemde orijinal sinyal tamamen kaybolana kadar kademeli olarak Gaussian gürültüsü eklenir. Bu teknik görüntü, ses ve video üretiminde baskın hale geldi ve araştırmacıları ilk olarak metin üzerinde denemeye yönlendiren de bu oldu.

Ayrıktan sürekliye ve geri

En erken dil difüzyonu denemeleri 2021'de geldi ve ayrık nitelikteydi: multinomial diffusion, D3PM ve SUNDAE, Gaussian bozulmasını kategorik veriye uygun işlemlerle değiştirdi. Dieleman'a göre zamanlama önemliydi. Bu, GPT-3'ün dikkatleri üzerine çektiği ama ChatGPT atılımının henüz yaşanmadığı, 2022 sonundan önceki döneme denk geliyordu ve ayrık difüzyon, otoregresyonun gerçek teorik zayıflıklarını — teacher forcing'in yarattığı exposure bias ile infilling ve kısıtlı üretimin sakarlığı dahil — düzeltiyor gibi görünüyordu.

2022'de ikinci bir dalda süreç yeniden sürekli hale geldi. Diffusion-LM, ayrık tokenları Gaussian gürültüsünün doğrudan bozabileceği sürekli embedding vektörleri olarak temsil etti ve aynı yıl bir dizi varyasyon izledi: DiffuSeq, SSD-LM, Difformer, SeqDiffuSeq, GENIE ve LD4LG, ayrıca Dieleman'ın ortak yazar olduğu iki makale, SED ve CDCD. Cazibenin, yazısına göre, kaldıraç etkisinde yatıyordu: sürekli yöntemler, görsel-işitsel üretimi ele geçirdikçe sürekli difüzyon çevresinde biriken örnekleme ve distillation tekniklerini ödünç alabiliyordu; bu araç çoğu zaman ayrık formülasyonlara uygulamak zor veya imkânsızdı.

2023 sonundaki yok oluş

Sonra sürekli dil difüzyonu fiilen ortadan kayboldu. Dieleman, kopuşu tartışmaya yer bırakmayacak şekilde gösteren, 2025 tarihli bir difüzyon dil modelleri araştırmasındaki bir diyagrama atıf yapıyor: 2024'ten itibaren neredeyse tüm yeni çalışmalar ayrık yöntemler kullandı.

Dieleman, her ikisi de açıkça spekülatif olan iki açıklama sunuyor. Biri, ChatGPT anının alanı teorik çekicilikten ham performansa doğru yeniden yönlendirdiği; araştırmacıların görünüşe göre kavramsal olarak otoregresyona daha yakın olan ayrık difüzyonun, otoregresif modelleri ölçekte yakalamak için daha iyi bir yol sunduğunu düşündüğü. Diğeri ise erken ölçeklendirme sonuçlarının sürekli yaklaşımlar için acımasız olduğuydu: Mayıs 2023'te Gulrajani ve Hashimoto, olasılık tabanlı sürekli bir difüzyon dil modeli olan Plaid-1B'yi, bir otoregresif referans modeline kıyasla 64 kat daha düşük eğitim verimliliğinde ölçtü. Dieleman'a göre, hâlâ eğitim hesaplamasını Chinchilla geleneğindeki gibi perplexity'ye göre optimize eden bir araştırma kültüründe, neredeyse iki büyüklük mertebelik bir fark eliyordu — oysa Şubat 2023'te yayımlanan LLaMA 1, çıkarım bütçelerinin de ağırlığı hak ettiği yönündeki savunmayı ancak yeni başlatmıştı.

Dieleman'ın kendisi de o dönemde bu alandan ayrılıp üretken görüntü ve video sistemleri geliştirmeye gitti ve yok oluşu kenardan bir miktar şaşkınlıkla izlediğini yazıyor.

Sürekli yöntemler neden yeniden ilgi görüyor

Son dönemdeki aktivite dalgası, ivmenin sürekli yöntemlere geri döndüğüne işaret ediyor. Dieleman, bu yöntemlerin alanın belki de fazla kolayca vazgeçtiği avantajlar taşıdığını savunuyor: tek tek token düzeyinde belirsizliği ifade etme kapasitesi ve diğer alanlarda sürekli difüzyon için geliştirilmiş geniş örnekleme algoritmaları ve hileleri repertuvarına erişim.

Neden önemli

Otoregresyona gömülü taahhütler, hem bugünün LLM'lerinin neler yapabileceğini hem de maliyetlerini şekillendiriyor: exposure bias, infilling ve kısıtlı üretimin sakar biçimde ele alınması ve doğası gereği sıralı olan bir kod çözme süreci. Sürekli difüzyon üzerine yenilenen çalışmalar 2023'te onu batıran verimlilik açığını kapatabilirse, dil modelleri görüntü difüzyonunu hızlı ve yönlendirilebilir kılan iyileştirmeleri miras alabilir; bu da gelecekteki LLM'lerde çıkarım hızı, düzenleme ve kontrol edilebilirlik açısından pratik sonuçlar doğurur. Dieleman anlatısının öznel olduğu konusunda açık sözlü ve itirazları davet ediyor, ama belgelediği yay — hızlı benimsenme, ani terk ediş ve şimdiki canlanma — araştırma yönünün o an moda olan verimlilik metriğine ne kadar duyarlı olduğunun da faydalı bir hatırlatıcısı.

  • #diffusion-models
  • #language-models
  • #machine-learning
  • #text-generation
  • #research

İlgili yazılar