MiniMax H3 v ComfyUI lokálně: tři AI videa na 12 GB VRAM

MiniMax H3 jsme spustili přímo na domácí RTX 5070 s 12 GB VRAM a 32 GB RAM. ComfyUI běželo lokálně, nikoli jako rozhraní pro cloudové API. Ze tří výchozích ilustrací jsme nechali vzniknout tři krátké klipy: konvici, chůzi člověka a jedoucí auto. Níže jsou skutečné výsledky, přesné parametry jednotlivých běhů, časy z historie ComfyUI i postup, jak si stejný typ testu připravit.

Upozornění k ukázkám: Všechny vstupní obrázky jsou vytvořené pomocí AI a všechna vložená videa jsou výstupy modelu MiniMax H3. Nejde o záznam skutečných osob nebo vozidel. Práva a omezení modelu popisujeme níže; nepovažujte tyto časy ani výsledky za univerzální benchmark jiných počítačů.

Co jsme skutečně testovali

Testovací počítač měl NVIDIA GeForce RTX 5070 s 12 GB VRAM a přibližně 32 GB operační paměti. ComfyUI hlásilo verzi 0.35.0. Použili jsme oficiální šablonu MiniMax H3 Image to Video, místní soubory modelu (video diffusion int8, textový enkodér Qwen3-VL NVFP4/AWQ, video a audio VAE) a režim Turbo s osmi kroky. Všechny ukázky jsou výstupem image-to-video: první snímek jsme modelu dodali, pohyb a zvuk dopočítal H3. Službu MiniMax API jsme nevolali.

Čas generování počítáme jako rozdíl mezi událostmi execution_start a execution_success v historii ComfyUI. Zahrnuje také případné načítání modelů a uložení souboru; není to izolovaný čas jediného samplovacího uzlu. Současně neuvádíme špičkovou spotřebu VRAM, protože jsme ji během běhu neměřili.

Tři vlastní ukázky: vstup, výsledek a čas

1. Konvice: jemný pohyb a světlo

Vstupem byla AI ilustrace červené keramické konvice. Zadání požadovalo stoupající páru, nepatrnou změnu světla a pomalé přiblížení kamery, ale zachování tvaru konvice i prostředí. Výsledek je spíše decentní záběr než výrazná animace: konvice zůstává rozpoznatelná, zatímco pára není přesně navázaná na hubičku. To je dobrá připomínka, že konkrétní detail nelze garantovat jen slovním zadáním.

AI ukázka MiniMax H3: konvice; vstupní obraz vytvořen pomocí AI, výstup generován lokálně.

Naměřeno: 864 × 480 px, 24 snímků/s, délka souboru 2,33 s, generování 53,3 s. Cílová velikost byla 0,4 MP; výsledné rozměry zaokrouhlil uzel Resolution Selector na násobky 32. Turbo režim: 8 kroků.

2. Člověk: kroky na parkové cestě

Vstupní AI obrázek zachycuje smyšlenou dospělou ženu v tyrkysové bundě. Požádali jsme o přirozenou chůzi vpřed v jediném souvislém záběru, s pohybem nohou a paží bez změny oblečení či přidání dalších lidí. Vygenerovaný klip skutečně ukazuje změnu postoje a postup po cestě. Při pozorném sledování pohybu je přesto vhodné kontrolovat ruce, nohy a kontinuitu kroku; jeden úspěšný klip není záruka bezchybné anatomie v dalších pokusech.

AI vstupní obrázek smyšlené ženy na parkové cestě pro lokální generování videa MiniMax H3
Vstupní AI ilustrace před animací: důležité je mít celou postavu a prostor pro pohyb.
AI video MiniMax H3: chůze smyšlené postavy; nejde o záznam reálné osoby.

Naměřeno: 1056 × 608 px, 24 snímků/s, délka souboru 5,17 s, generování 190,9 s. Cíl 0,6 MP, Turbo 8 kroků, stejné lokální zařízení.

3. Auto: pohyb s kamerou, která vůz sleduje

Poslední vstupní AI obrázek ukazuje neoznačené modré auto na prázdné silnici. První pokus se statickou kamerou sice ukázal pohyb, ale auto na konci vyjelo ze záběru. Do publikované ukázky jsme proto vybrali nový běh: zadání říká, aby kamera auto plynule sledovala a vůz zůstával celý v obraze. Ve výsledku je patrný posun pozadí vůči autu; vzhled vozu zůstává použitelný pro krátkou demonstraci. Je to také praktický příklad toho, že úprava popisu pohybu kamery může napravit kompoziční chybu bez změny modelu.

AI vstupní obrázek neoznačeného modrého auta na prázdné silnici pro test MiniMax H3
Vstupní AI ilustrace auta. Druhý prompt nechává kameru sledovat vůz.
AI video MiniMax H3: jedoucí auto s kamerou sledující pohyb.

Naměřeno: 1056 × 608 px, 24 snímků/s, délka souboru 5,17 s, generování 256,6 s. Cíl 0,6 MP, Turbo 8 kroků. První, nezveřejněný pokus se statickou kamerou trval 242,8 s, ale kompozici nesplnil. Rychlost mezi jednotlivými běhy nesrovnávejte jako čistý vliv obsahu scény: lišit se může načítání, uvolňování paměti i zpracování konkrétního klipu.

Jak postup zopakovat v ComfyUI

  1. Aktualizujte ComfyUI. Podle oficiálního návodu je pro H3 potřeba verze 0.30.0 nebo novější. Naše ukázky vznikly ve verzi 0.35.0.
  2. Načtěte oficiální šablonu. Otevřete Template Library → Video → MiniMax H3 I2V, případně stáhněte oficiální JSON workflow. Důležitý je právě místní workflow H3, ne cloudové partner/API uzly.
  3. Doplňte přesné soubory modelů. I2V používá minimax_h3_fl2va_pruned_int8_convrot.safetensors v models/diffusion_models, qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors v models/text_encoders, minimax_h3_video_vae_int8_convrot.safetensors a minimax_h3_audio_vae_fp32.safetensors v models/vae. Pro Turbo přidejte minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors do models/loras. Přímé odkazy a umístění najdete v oficiální dokumentaci I2V. Jiný soubor video VAE, například fp16, není automatickou náhradou za přesný název v šabloně.
  4. Nahraďte výchozí obrázek. V uzlu Load Image vyberte vlastní snímek. Ukázkový obrázek myši není součástí vašeho projektu a bez nahrání může chybět. U člověka pomůže celá postava a místo pro krok; u auta nechte prostor ve směru jízdy.
  5. Nastavte výstup a pohyb. Pro první pokus volte poměr 16:9, přibližně 0,4 MP, dvě sekundy a Turbo s osmi kroky; náš delší test používal 0,6 MP a pět sekund. Napište, co se má hýbat, co má zůstat stejné a zda se hýbe kamera. H3 převádí délku na vlastní mřížku snímků (17k+5 při 24 fps), takže výsledná délka nemusí přesně odpovídat zadaným sekundám.
  6. Spusťte Queue a ověřte výsledek. Nestačí hláška o přijetí úlohy: zkontrolujte video v output, jeho skutečné rozměry, délku, zvuk i vzhled. Při chybě chybějícího modelu zkontrolujte přesný název v uzlu. Pokud paměť nestačí, snižte rozlišení a délku, případně zapněte Turbo; netvrdíme, že 12 GB VRAM stačí na všechny délky a plné 2K.

Co z výsledků vyvodit — a co ne

Tyto tři běhy dokazují, že konkrétní sestava zvládla lokální MiniMax H3 I2V v uvedeném rozlišení a délce. Nedokazují, že pětisekundový klip v nativním nebo 2K rozlišení poběží na 12 GB stejně, ani že se každý seed povede. Krátký test konvice vyšel rychleji než delší ukázky; měnili jsme však současně délku i rozlišení, a proto jej nelze označit za měření výkonu při stejných podmínkách.

Vstupní obrázky jsme vygenerovali pomocí OpenAI image modelu a videa vznikla lokálně modelem MiniMax H3. U ukázky s člověkem nejde o konkrétní reálnou osobu, u auta nejde o skutečnou značku ani reklamní záběr. Chcete-li použít vlastní fotografii osoby, nejprve si ověřte její souhlas a práva k obrázku.

Licence a zdroje

Komunitní licence MiniMax H3 vylučuje Evropskou unii ze svého základního územního rozsahu. Pro použití na tomto webu jsme vycházeli z individuálního potvrzení MiniMaxu adresovaného testnuto.cz prostřednictvím formuláře pro vyloučená území. Tato informace není obecným povolením pro jiné weby: vlastní podmínky si vždy ověřte. Veřejné ukázky výslovně označujeme jako generované AI v souladu s pravidlem zveřejnění původu obsahu.

Technické podklady: přehled MiniMax H3 v ComfyUI, oficiální I2V workflow a soubory modelů. Naměřené časy a rozměry pocházejí z historie skutečných běhů ComfyUI a kontroly vytvořených MP4, nikoli z marketingového odhadu.

Diskuze

Vaše e-mailová adresa nebude zveřejněna. Vyžadované informace jsou označeny *