deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Linum, üretken video ön eğitim için veri filtrelemenin CV'den RL'ye nasıl evrildiğini anlattı

Linum'un saha notları, ön eğitim veri filtresinin yalnızca CPU'lu bilgisayarlı görüden ince ayarlı LLM'lere ve pekiştirmeli öğrenme rubriğine nasıl geçtiğini ve openabilirliğin bir video modelinin ne öğrendiğini neden belirlediğini izliyor.

Linum, üretken video ön eğitim için veri filtrelemenin CV'den RL'ye nasıl evrildiğini anlattı

Veri mimariden önce gelir

Üretken video araçları geliştiren bir ekip olan Linum, görüntü ve video diffusion modelleri için ön eğitim verisini filtrelemeye dair bir saha notu yayımladı; yazı Hacker News ana sayfasına kadar yükseldi. Merkezî iddiası şu: Stable Diffusion 3'ten bu yana model iç yapıları neredeyse değişmedi — modern sistemler özünde v-prediction hedefiyle eğitilmiş bir transformer omurgası üzerinde flow matching olarak kalıyor — ve son dönemdeki ilerlemenin çoğu ağın nasıl tasarlandığından değil, eğitime neyin girdiğinden geliyor.

Linum'a göre bu iyileşmenin büyük kısmı üç tür veri çalışmasından kaynaklanıyor: ham derlemin filtrelenmesi ve yeniden dengelenmesi, ayrıntılı açıklamalar ve bounding box'lar gibi daha zengin etiketleme ve doğal kapsamı az olan görevler için ince ayarlı üretken modellerden oluşan topluluklarla üretilen sentetik veri. Pekiştirmeli öğrenme de katkı vermeye başladı; ancak şirket, bunun görüntü ve video için ancak son birkaç ay içinde güvenilir biçimde çalışmaya başladığını belirtiyor.

CPU sezgisellerinden öğrenilmiş bir rubriğe

Linum'un filtreleme yığını üç nesil geçti: 2024'te ucuz CPU örneklerinde klasik bilgisayarlı görü algoritmaları, 2025 başında GPU'larda ince ayarlı LLM'ler ve 2025 sonuna doğru pekiştirmeli öğrenmeyle öğrenilmiş bir rubrik. Eşlik eden diyagramın itiraf ettiği üzere, o son aşama bile iki yönde de hata yapıyor — tutması gereken klipleri atıyor, atması gereken klipleri tutuyor. 2024 sürümü bilinçli bir maliyet kararındaydı: Ekip, on milyarlarca görüntü ve videoyu işlemek için büyük bir GPU filosundan ya da birkaç milyon dolarlık GPT-4 token faturasından kaçınmak istiyordu.

İlk aşama PySceneDetect ile sahne algılamaydı; araç karelerin kayan bir penceresini tutuyor ve bir sonraki karenin görüntü istatistikleri keskin biçimde saptığında bir geçiş işaretliyor. Makine öğrenmesi devrede olmadığından hızlı çalışıyor, ancak Linum bunun çözülüşlerde, solma geçişlerinde ve titrek kesmelerde güvenilmez olduğunu tespit etti — kulağa geldiğinden daha büyük bir sorun bu.

Yazıya göre videoları çekim sınırlarında dilimlemek önemli, çünkü ne zaman kesme yapılacağına karar vermek yazarlığa dair bir tercih ve üretken bir model bunu keyfi bir davranış olarak içselleştirmemeli. Linum ayrıca video öncesinde görüntü üretimiyle ön eğitim yapıyor; modellerin statik içeriği hareketten önce öğrendiğinde daha iyi ve daha hızlı yakınsadığını bildiriyor.

Filtrelemeden önce veriyi tanımak

Herhangi bir sezgiseli ayarlamadan önce Linum, günlerce rastgele örnekler inceleyip iyi ve kategorilerin, oranlarıyla birlikte bir taksonomisini taslak etmeyi öneriyor. Bu notlar, mühendislerin mükemmel bir karar sınırının peşinde sonsuza dek koşmasını engelleyen referansı oluşturuyor; ayrıca hangi kategorilerin doğal dağılımda baskın olduğunu ve alt örneklemeye ihtiyaç duyduğunu ortaya çıkarıyor — aksi halde yaygın içerik eğitimi eziyor ve model, ihtiyaç duyduğu kişilerin, yerlerin ve eylemlerin uzun kuyruğunu hiç öğrenemiyor.

Dilin yakalayamadığını kaldırmak

En ayırt edici filtre openabilirliği hedefliyor. Metin birincil koşullandırma sinyali olduğundan, çekiciliği net biçimde tanımlanamayan klipler gürültü sayılıyor. İki kategori kesildi: LLM'lerin ekranı okuyabildiği ama ekrandaki metnin ne zaman ve nasıl değiştiğini anlatmakta zorlandığı metin ağırlıklı videolar ve açıklayması zor eylemler — çok az görünür hareket içeren yakın çekimler ya da sallanan kamera veya kalabalık bir futbol maşı gibi kaotik sahneler.

Metin filtresi, örneklenmiş karelerde 2017 döneminden küçük bir CNN olan EAST'ı çalıştırdı; videoları kaç karede metin olduğu ve her karenin ne kadarını kapladığıyla puanladı. On milyarlarca kareyi CPU'lardan geçirmek için karelerin agresif biçimde küçültülmesi gerekti; bu da küçük yazı tipli, metin ağırlıklı örneklerin sızmış olmasına izin verdi. Performans ayarlarından sonra bile EAST, hattın en kötü darboğazı olarak kaldı ve büyük bir CPU kümesinde haftalar aldı.

Linum bunu bir kapasite sorunu olarak çerçeveliyor: 2 milyar parametreli bir model, şirketin hedefi animasyon araçlarıyken bütçesini hareket grafiklerine harcamamalı. Yazı, referansla koşullandırılmış video üretimine karşı da kuşkucu; bunu dilin ifade edemediği özellikleri kontrol etme girişimlerinin ilki olarak adlandırıyor ama gerçek yazarlık niyetini aktarmak için yeterince iyi olmadığını söylüyor.

Neden önemli

Alan, bir avuç birbirine neredeyse özdeş mimari üzerinde uzlaştıkça, veri düzenleme model kalitesi için ana kaldıraç hâline geliyor — ve Linum'un anlatısı bu kaldıracın ne kadar emek yoğun ve hataya açık olduğunu gösteriyor; 2017 tarihli bir metin dedektörünün haftalarca CPU zamanı harcamasından iyi klipleri sessizce atan hatlara kadar. Diffusion modeli eğiten herkes için pratik ders şu: filtreleme kararları doğrudan bir modelin ne öğrenebileceğini şekillendiriyor ve kesiyi neyin geçtiüna openabilirlik karar veriyor — yalnızca görsel kalite değil.

  • #ai
  • #diffusion-models
  • #video-generation
  • #data-curation
  • #training-data

İlgili yazılar