deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Linum'un JiT-DDT'si sıkıştırmayı diffusion modeline katlayarak text-to-image eğitim maliyetini 3,6 kat düşürüyor

Linum, pixel-space tabanlı JiT-DDT mimarisiyle 512×512 bir text-to-image modelini, latent-diffusion taban çizgisine göre 3,6 kat daha az GPU-saati ile eğittiğini duyurdu; kod ve ağırlıklar Apache 2.0 lisansıyla yayınlandı.

Linum'un JiT-DDT'si sıkıştırmayı diffusion modeline katlayarak text-to-image eğitim maliyetini 3,6 kat düşürüyor

GPU-saatleriyle ölçülen 3,6 katlık iddia

Linum, yeni text-to-image mimarisi JiT-DDT için sonuçları yayınladı. Şirkete göre bu model, önceki sistemine kıyasla 3,6 kat daha az GPU-saatiyle eğitildi ve dört kat daha fazla piksele sahip görüntüler üretiyor. Hacker News'in ana sayfasına ulaşan yazı, bitmiş bir ürün değil bir araştırma çıktısı olarak konumlandırılıyor: kod ve model ağırlıkları Apache 2.0 lisansıyla sunuluyor ve Linum, bunu Linum v3 yolunda bir kontrol noktası olarak tanımlıyor.

Attention maliyeti bütçeyi belirliyor

Linum'a göre önceki modeli Linum v2'yi en çok kısıtlayan şey attention bağlamının (context) boyutuydu. Beş saniyelik 720p bir klip kabaca 110.000 token'a genişliyor; buna karşılık dil modelleri ön eğitiminin %97'sini 8.000 token'ın altındaki dizilerde geçiriyor. Attention maliyeti dizi uzunluğuyla kuadratik olarak arttığından Linum, bağlam penceresini küçültmenin üretici (generative) model eğitimini hızlandırmanın tek en büyük kaldıracı olduğunu savunuyor.

Latent diffusion neden duvara tosladı

Günümüzdeki görüntü ve video üreticilerinin çoğu latent diffusion modelidir: bir variational autoencoder pikselleri token'lara sıkıştırır ve ayrı bir diffusion transformer (DiT) bu latent uzayında üretim yapar. VAE önce eğitilir ve sonra dondurulur; dolayısıyla üretici model, üretimden çok yeniden yapılandırma (reconstruction) için tasarlanmış bir temsil içinde çalışmak zorundadır.

Linum, FLUX, Ideogram ve Z-Image gibi popüler açık modellerin hepsinin token sayısında 16×16 azaltmada durduğuna dikkat çekiyor; şirketin kendi önceki deneyleri de standart bir CNN VAE'nin yeniden yapılandırmalar gözle görülür biçimde bozulmadan ne kadar sıkıştırabileceğine dair pratik bir sınır olduğunu gösteriyor. Linum v2, 8×8 bir VAE ile DiT içindeki 2×2 patchification'ı birleştirerek genel olarak yine aynı 16×16 rakamına ulaşmıştı.

İki model yerine tek model

2025'te Tianhong Li ve Kaiming He, VAE'yi tamamen kaldırıp sıkıştırmayı diffusion transformer'ın kendisinin yapmasını sağlayan ve 32×32 token azaltmaya ulaşan JiT'yi yayınladı. Patchification hilesi vision transformer'lara dayanıyor, ama bu kadar ileri taşınması eğitilemez kabul ediliyordu. Linum'un görüntü-altyazı veri kümesinde düz bir JiT de ince detayları üretmekte zorlandı; Linum bu yüzden, detayı geri kazandırdığını ve latent-diffusion karşılığından daha verimli eğitildiğini söylediği encoder-decoder türevi JiT-DDT'yi tasarladı.

Mimariden çok hedef fonksiyon

En ilginç teknik iddia, agresif sıkıştırmanın daha önce neden başarısız olduğuyla ilgili. VA-VAE gibi 2025'in başındaki çalışmalar, diffusion transformer'ların yüksek boyutlu girdilerden öğrenmekte zorlandığını gösterdi ve üreticiler çeşitli geçici çözümler benimsedi: Linum, VAE eğitimi sırasında DINOv3 gibi bir harici regularizer'ın muhtemelen FLUX-2'nin latent boyutluluğunu 64'ten 128'e çıkarmasını sağladığını öne sürüyor. Linum'a göre bu düzeltmeler altta yatan öğrenilebilirlik sorununu çözmek yerine erteliyor.

Teşhis şu: agresif patchification bilgiyi kanal boyutuna sıkıştırıyor ve ortaya çıkan kararsızlık, flow matching eğitiminin standartlaştığı v-prediction, v-loss hedefinin yan etkisi — mimarinin kendisinin değil. Flow matching'de veri örneği, gürültü ve hız doğrusal olarak birbirinin yerine geçebildiğinden, eğitici ağın hangi niceliği tahmin edeceğini ve loss'un hangisini ölçeceğini seçebilir. Li ve He, oyuncak bir spiral dağılımını giderek büyüyen uzaylara yansıtarak boyutluluk arttıkça çalışmaya devam eden tek varyantın x-prediction olduğunu buldu. Bu hedefi benimsemek, ağır sıkıştırılmış tasarımı eğitilebilir kılan şeydir.

Rakamlar

Linum, taban çizgisine — 256 latent token'dan 256×256 görüntü üreten, yalnızca görüntü kullanan bir checkpoint ile 2,0 milyar parametreli latent-space DiT artı VAE — karşı JiT-DDT'nin pixel-space bir DiT içinde 2,5 milyar aktif parametre kullandığını, 320 token'dan (64 encoder, 256 decoder) 512×512 görüntü ürettiğini ve bu noktaya 3,6 kat daha az GPU-saatiyle ulaştığını raporluyor.

Neden önemli

GPU-saatleri üretici yapay zekâdaki baskın maliyettir ve 3,6 katlık bir azalma, bir benchmark merakı değil büyük ve pratik bir verimlilik kazanımıdır. Token tasarrufu videoya — Linum'un 110.000 token'lık örneğinin yaşadığı alana — taşınırsa, kuadratik attention kazancı katlanarak büyür. Apache 2.0 sürümü diğer laboratuvarların da x-prediction iddiasını bağımsız olarak test etmesini sağlıyor. Bariz uyarı ise şu: karşılaştırma, Linum'un kendi yeni mimarisiyle Linum'un kendi taban çizgisi arasında, Linum'un kendi verisiyle yapılıyor; gerçek test bağımsız tekrarlanma olacak.

  • #text-to-image
  • #diffusion-models
  • #machine-learning
  • #open-source
  • #image-generation

İlgili yazılar