MiniMax H3 en local : quelle quantification, combien de VRAM, quel temps de rendu

H3 tourne sur du matériel grand public depuis la sortie des poids en août 2026, et les guides d’installation s’accordent sur les étapes. Là où ils divergent — ou se taisent — c’est sur les chiffres : quelle quantification pour quelle carte, et combien de temps vous allez réellement attendre. Cette page rassemble les mesures publiées.

Voir le plan illimité
Un PC de bureau panneau ouvert, carte graphique allumée à l’intérieur, à côté d’un écran affichant un montage vidéo.
Tout tient sur une machine — et la carte est occupée plusieurs minutes par clip.

Choisissez la quantification avant tout le reste

Les poids publiés se divisent en deux familles : fl2va pour le texte- et l’image-vers-vidéo, ref2va pour la génération guidée par référence. Les deux sont distribués en quantifications GGUF, et le fichier que vous choisissez détermine tout le reste.

Les poids BF16 d’origine pèsent environ 123,6 Go, ce qui explique que personne ne les fasse tourner chez soi. Les quantifications communautaires ramènent une configuration utilisable autour de 21 Go.

Un avertissement à répéter : les versions Q8_CR et U16G dépendent des nœuds ComfyUI-GGUF et ne se chargeront pas ailleurs.

Quantificationfl2varef2vaRemarques
Q4_011,4 Go11,4 Go4 bits standard. Le plus petit, la qualité la plus basse.
U16G15,0 Go15,0 GoINT8 + Q4_0 mélangés. Plus rapide que Q4_0 au-delà de 16 Go.
Q8_CR20,2 Go20,2 GoQualité Q8_0 avec des poids INT8 ConvRot.
Q8_020,2 Go21,4 Go8 bits standard. La meilleure qualité des quatre.
Tailles telles que publiées dans le dépôt GGUF communautaire. Q8_CR et U16G exigent ComfyUI-GGUF.

Ce que chaque carte permet, et le temps que cela prend

Ce sont des mesures rapportées au moment de la sortie, pas un banc d’essai contrôlé : elles varient selon la stratégie de déchargement, la vitesse du stockage et la RAM disponible. À lire comme un ordre de grandeur, pas comme une promesse.

La logique en dessous reste constante : sous 16 Go vous échangez des minutes contre la simple capacité à charger le modèle ; au-dessus de 24 Go, c’est la toile qui s’ouvre avant l’horloge.

VRAMCartes typiquesToile exploitableTemps pour 5 s
8 GoRTX 3070 · 4060 · 3060 Ti640×360 – 832×4809–10 min (RTX 3070)
12 GoRTX 3060 · 4070 · 2080 Ti0,4 MP par défautmoins de 9 min (RTX 3060, 20 étapes)
16 GoRTX 4070 Ti Super · 4080 · 5070 Ti0,4–0,5 MP ; 768p avec Turbo LoRA~3 min (4090 portable, 960×540)
24 GoRTX 3090 · 4090Toile complète 1344×768Quelques minutes
32 GoRTX 5090Toile complète, jusqu’à 15 s~10 min (GGUF Q5, 20 étapes)
Retours individuels, pas un banc d’essai. Sous 16 Go, la RAM système compte autant que la VRAM.

Achetez de la RAM avant d’acheter de la VRAM

C’est le conseil qui revient dans chaque retour sur petite configuration, et il est assez contre-intuitif pour mériter d’être dit franchement : quand le modèle ne tient pas, ComfyUI diffuse le reste depuis la mémoire système. Une carte de 12 Go avec 32 Go de RAM termine ; la même avec 16 Go rame ou fige la machine.

Comptez 32 Go de RAM système comme plancher pour une carte de 12 Go, et 64 Go si vous êtes en 16 Go et voulez que ce soit fluide. Un NVMe rapide compte pour la même raison — ce qui quitte le GPU doit revenir de quelque part.

Deux optimisations valent toutes les autres

Turbo LoRA est la plus importante. Elle ramène le nombre d’étapes à 8 pour le texte- et l’image-vers-vidéo et à 4 pour la référence-vers-vidéo, et fait gagner plus de temps que n’importe quel changement de quantification.

Sage Attention vient ensuite, via le nœud `Patch Sage Attention KJ` de ComfyUI-KJNodes. Elle abaisse le pic de VRAM dans les couches d’attention, ce qui transforme une carte qui sature en une carte qui termine.

Tout le reste est un levier plus petit. Faites d’abord tourner un flux simple, puis ajoutez-en une à la fois — une optimisation ajoutée avant d’avoir une référence ne se distingue pas d’une installation cassée.

TechniqueEffetQuand l’utiliser
Turbo LoRA8 étapes (T2V/I2V), 4 (R2V)Toujours. Le plus gros gain.
Sage AttentionAbaisse le pic de VRAM en attentionQuand la VRAM sature pendant l’échantillonnage.
Déchargement dynamiqueDiffuse une partie vers la RAM systèmeQuand le modèle ne tient pas du tout.
Attention basse VRAM KJNodesMoins de pic, sortie identiqueMême cas, sans coût de qualité.
Plus de RAM systèmeRend le déchargement viableAvant tout achat de GPU sous 16 Go.

Les réglages de départ

Commencez petit et ne changez qu’une variable à la fois. Les valeurs ci-dessous sont les officielles ; les modifier avant d’avoir un rendu propre, c’est perdre un après-midi.

Une chose qui ressemble à un bug et n’en est pas : le nombre d’images s’aligne sur le `17k+5` de H3, donc une demande de 5 secondes donne environ 124 images — 5,17 s à 24 fps.

RéglageValeur
ComfyUI0.30.0 ou plus récent
Toile de test864×480 (0,4 MP)
Cible native1344×768 (0,98 MP)
Étapes20 (défaut officiel)
Échantillonneurres_multistep
Planificateursimple
SortieVidéo 24 fps + audio stéréo 32 kHz, MP4

Quand ça casse, c’est toujours de la même façon

La plupart des échecs au premier lancement sont dans cette liste, et aucun ne signifie que le modèle ne convient pas à votre machine.

SymptômeCause habituelleCorrectif
Nœuds ou modèles absentsComfyUI antérieur à 0.30.0Mettre à jour puis redémarrer complètement.
Modèle absent du chargeurMauvais dossier ou nom de fichierVérifier `diffusion_models/`, `text_encoders/`, `vae/` ; redémarrer.
R2V échoue, T2V passefl2va chargé au lieu de ref2vaSélectionner le checkpoint ref2va.
Mémoire CUDA saturéeToile ou durée au-delà du plan mémoireRevenir à 0,4 MP, 5 s, lot 1. Une variable à la fois.
La machine se figeDéchargement au-delà de la RAM systèmeFermer les autres applis, libérer du disque, reprendre la base.
R2V bien plus lent que T2VRéférences trop nombreuses ou trop grandesMettre `ref_image_size: match`, réduire le nombre de références.
Vidéo enregistrée sans sonVAE audio non relié à CreateVideoRelier les deux sorties VAE, vidéo et audio.

Générer petit, agrandir ce qu’on garde

Ce n’est pas un compromis lié à la VRAM — c’est la conception même de H3. Le modèle de base rend à sa taille native et une passe séparée agrandit ; MiniMax a séparé ces deux travaux parce que les pixels coûtent beaucoup moins cher à ajouter après coup qu’à générer.

La même séparation est la bonne habitude sur n’importe quelle machine. La plupart des prises finissent à la corbeille — la quatrième, celle où la main est ratée — et passer chacune à l’agrandissement dépense la moitié coûteuse du pipeline sur des images que vous allez supprimer. Générez petit, regardez, agrandissez seulement ce que vous gardez.

Si le problème, c’est le matériel

Tout ce qui précède suppose une carte à plusieurs centaines d’euros immobilisée pendant des minutes par clip. Si ce n’est pas votre situation, la voie réaliste est un service hébergé qui ne facture pas au clip — parce que la boucle générer-puis-jeter est exactement ce qui rend la facturation à l’unité douloureuse.

HelloGen est la meilleure option que nous connaissions pour cela : génération H3 illimitée avec le plan Pro, 0 crédit par clip, avec au moins 2 rendus prioritaires par jour et la vitesse standard au-delà. La même habitude générer-petit-puis-agrandir, sans la machine.

Questions fréquentes

Quelle VRAM faut-il pour MiniMax H3 ?

8 Go suffisent avec une quantification GGUF Q2/Q3 et 32 Go de RAM système, pour environ 9–10 minutes par clip de 5 secondes. 12 Go est confortable en 0,4 MP. 24 Go fait tourner la toile complète 1344×768. Sous 16 Go, la RAM système compte autant que la carte.

Quelle quantification GGUF choisir ?

U16G à 15,0 Go est le bon compromis à partir de 16 Go — poids INT8 et Q4_0 mélangés, rapportée plus rapide que Q4_0. Q8_0 (20,2 Go fl2va, 21,4 Go ref2va) pour la qualité ; Q4_0 à 11,4 Go pour la plus petite empreinte. Q8_CR et U16G exigent les nœuds ComfyUI-GGUF.

Combien de temps prend un clip de 5 secondes en local ?

Les retours vont d’environ 3 minutes sur un 4090 portable 16 Go en 960×540 avec Sage Attention, à 9–10 minutes sur une RTX 3070 de 8 Go. Turbo LoRA réduit ce temps plus que tout changement de quantification.

Quels sont les réglages officiels ?

20 étapes, échantillonneur res_multistep, planificateur simple, 864×480 pour tester et 1344×768 comme cible native, sur ComfyUI 0.30.0 ou plus récent. Sortie en 24 fps avec audio stéréo 32 kHz.

Pourquoi mon clip de 5 secondes fait-il 124 images ?

H3 aligne le nombre d’images sur 17k+5 : une demande de 5 secondes tombe donc à environ 124 images, soit 5,17 s à 24 fps. C’est le comportement attendu, pas un bug.

Peut-on utiliser H3 sans GPU local ?

Oui, via un service hébergé. HelloGen inclut la génération H3 illimitée avec le plan Pro, 0 crédit par clip, avec au moins 2 rendus prioritaires par jour.

À lire ensuite

Prêt à le faire vous-même ?

Décrivez-le avec vos mots et voyez le résultat en quelques secondes.

Voir le plan illimité