deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

dev.to derlemesine göre MiniMax H3, aynı GPU'larda dört kat sapabilen local render süreleri sergiliyor

20 topluluk başlığını derleyen bir dev.to yazısı, MiniMax H3 render sürelerinin aynı GPU'da workflow ayarlarına bağlı olarak yaklaşık dört kat değiştiğini ve 12 GB VRAM'in ayarlanmış bir workflow ile modeli çalıştırabildiğini ortaya koyuyor.

dev.to derlemesine göre MiniMax H3, aynı GPU'larda dört kat sapabilen local render süreleri sergiliyor

Tek bir GPU, dört katlık bir yayılım

dev.to'daki bir yazı, geçtiğimiz aydan kalma yaklaşık 20 topluluk başlığından MiniMax H3 zamanlama ve VRAM verilerini bir araya getiriyor; ve başlıca bulgusu sezgilere aykırı: tek bir GPU modeli içindeki render süreleri arasındaki fark, farklı kartlar arasındaki farktan daha büyük. Bir RTX 5090 sahibi, 8 step ve Turbo sampler kullanarak 768×1024 çözünürlükte 362 kare için yaklaşık 22 dakika bildirirken, diğer 5090 kullanıcıları benzer işleri 3 ila 5 dakikada tamamladıklarını yazdı. Yazıya göre her iki iddia da doğru ve fark donanımdan değil optimizasyondan kaynaklanıyor.

Derlenen rakamlar çok çeşitli kurulumlara yayılıyor. Yalnızca 5090'da derleme, turbo olmadan 20 step'te 896×1120 için 10 dakika 16 saniye, belirtilmemiş "5 dakikanın altında", 15 saniyelik bir klip için 134 saniye ve 12 GB için optimize edilmiş bir workflow ile 90 saniyelik video için yaklaşık 11 dakika listeliyor. Donanım basamağında daha aşağıda bir RTX 3090, 6 step'lik turbo LoRA ve attention optimizasyonuyla yaklaşık 3 dakika oluyor; 64 GB sistem RAM'e sahip bir 5070 Ti, 608×352'de 118 saniye cold ve 93 saniye warm süre kaydetti (480×864'de 230 saniye); aynı RAM'e sahip bir 4070 ise varsayılan 608×352 workflow'unu 167 saniyede tamamladı.

Dört ayar varyansın çoğunu açıklıyor

Yanıt başlıklarını okuduktan sonra yazar, yayılımın arkasındaki dört tekrarlayan etkeni tespit ediyor. Birincisi, step sayısı 20'den 4–6'ya düşürülmüş Turbo LoRA — tek başına en büyük etken olarak tanımlanıyor. İkincisi, attention backend; SageAttention yavaş süreler için defalarca çözüm olarak gösteriliyor. Üçüncüsü, SLA speedup — bir yanıt, 22 dakikalık rakamı doğrudan bunun kullanılmamasına bağlıyor. Dördüncüsü, çözünürlük ve toplam megapiksel: 608×352 ile 896×1120 arasındaki fark iş miktarında büyük bir fark yaratıyor ve insanlar çoğu zaman ikisini de belirtmeden süre paylaşıyor.

Yazının benchmark yapan herkese tavsiyesi, dolaşımdaki rakamların yarısı bu bilgiler olmadan kullanılamaz olduğu için her zaman çözünürlük, kare sayısı, step sayısı ve Turbo LoRA durumunu raporlamak.

VRAM tabanı varsayılandan daha düşük, ama bir şerhle

Derlemeye göre H3'ü çalıştırmak için 12 GB VRAM yeterli. 32 GB sistem RAM'e sahip bir 3080 12 GB'dan çalışan kurulum raporları var ve özel olarak geliştirilmiş bir düşük VRAM workflow'u, 12 GB'lık bir kartta yaklaşık 14 dakikada 30 saniyelik çıktı üretti. Şerh şu: burada sistem RAM en az VRAM kadar önemli. Çalışan 12 GB raporları 32–64 GB RAM ile eşleştirilmiş durumda ve 16 GB VRAM ile 128 GB RAM'e sahip bir 5060 Ti, varsayılan text-to-video şablonunda yine de out-of-memory hatası verdi. Yazının sonucu şu: varsayılan şablon orta segment kartlar için ayarlanmamış ve tabanı gerçekten düşüren şey, düşük VRAM workflow'una geçmek.

30 saniyelik üretim birleştirilmiş

Buna göre plan yapmadan önce bilmeye değer: 30 saniyelik düşük VRAM workflow'u, üç 10 saniyelik klibi birleştiren comfyui-h3-multishot'a dayanıyor. Yazı geçiş noktalarının (seam) ele alındığını söylüyor, ancak bu yerel tek geçişli (single-pass) bir üretim değil ve kesintisiz tek çekim gerektiren biri, karar vermeden önce bunu test etmeli.

"$0 API maliyeti"nin ekonomisi

Derleme ayrıca "$0 API maliyeti" çerçevesine itiraz ediyor; özgün 5090 gönderisinin en üst yanıtından, kuyruk düğmesine basmadan çok önce donanımın yeterince paraya mal olduğuna dair bir gözleme dikkat çekiyor. Yazar, bir başabaş formülü öneriyor — donanım maliyetinin saniye başına klip süresine bölümü, saniye başına API üretiyle çarpılır — ve şirketle bir bağını açıklayarak hosted H3 ücretlerini 768P'de saniye başına $0.074 ve 2K'da saniye başına $0.119 olarak veriyor. Bu ücretlerle 10 saniyelik bir 768P klip yaklaşık $0.74 tutuyor; yani $2,000'lık bir kart, elektrik ve bekleme süresi hariç, yaklaşık 2,700 klip civarında kendini amorti ediyor.

Hangi yaklaşımın nerede kazandığı konusunda yazı net konuşuyor: yerel üretim yüksek hacim, sürekli iterasyon, özel LoRA'lar, içerik kısıtlamalarının olmaması ve deneme başına 3 ila 20 dakikalık bekleme toleransı için uygun. Hosted API'ler ise düşük veya patlamalı hacim, acil ihtiyaçlar, bellek tabanının altındaki kartlar ve yerel bellek baskısının ağırlaştığı 2K çıktı için uygun.

Neden önemli

H3, dağınık anekdotların mevcut pratik rehberin ana kaynağı olacak kadar yeni; ve bu derleme üç şeyi somutlaştırıyor. Yerel video üretim performansında donanım değil, yapılandırma baskın — step sayısını ve attention backend'ini ayarlamak bir GPU yükseltmesinden daha fazla fark yaratabilir. Gerçekçi giriş noktası, varsayılan şablon değil; ayarlanmış bir workflow ile 12 GB VRAM artı 32–64 GB sistem RAM. Ve karşılaştırılabilir benchmark'lar tam ayar ifşası gerektiriyor; yazının kapanışındaki çözünürlük, kare, step ve attention ayarlarıyla birlikte süre çağrısı, topluluğun şu an eksik olduğu disiplini gözler önüne seriyor. Orta segment bir kartın yeterli olup olmadığını merak eden kararsız alıcılar için ise başabaş aritmetiği çoğu zaman yeni donanımdan ziyade API'nin daha ucuz olduğunu gösteriyor.

  • #video-generation
  • #comfyui
  • #vram
  • #local-inference
  • #benchmarking