- Blog
- Guide de configuration locale MiniMax H3 : ComfyUI, modèles, VRAM et premier rendu
Guide de configuration locale MiniMax H3 : ComfyUI, modèles, VRAM et premier rendu

AI Overview
MiniMax H3 peut-il fonctionner localement ?
Oui. MiniMax a publié les poids H3 et des packages compatibles avec ComfyUI, mais une installation utilisable nécessite le modèle de diffusion approprié, l’encodeur de texte, le VAE vidéo, le VAE audio, le workflow correspondant, ainsi qu’une quantité suffisante de mémoire système pour le déchargement (offloading).
Quelle quantité de VRAM MiniMax H3 requiert-elle ?
Il n’existe pas d’exigence unique, car la précision, la quantification, la résolution, la durée et le déchargement modifient l’usage mémoire. Une carte graphique de 24 Go constitue une cible pratique pour des workflows élagués en INT8 ; les cartes plus petites exigent une quantification plus forte et davantage de patience.
Quel modèle MiniMax H3 dois-je télécharger ?
Choisissez FL2VA pour la génération guidée par du texte, la première image, la dernière image ou une image. Choisissez Ref2VA lorsque le workflow consomme plusieurs images de référence, vidéos ou fichiers audio. Ne téléchargez jamais aveuglément l’ensemble du dépôt.
Une exécution locale de H3 est-elle meilleure que Seedance Agent ?
H3 local offre un contrôle maximal sur le graphe et les fichiers. Seedance Agent est préférable si vous souhaitez obtenir des sorties H3 sans gérer vous-même les pilotes, les poids, les contournements liés à la VRAM, les registres de prises, les validations ni les réexécutions partielles.
Déterminez si votre machine est prête
Vérifiez conjointement la mémoire GPU, la RAM système et l’espace de stockage
Un guide de configuration locale de MiniMax H3 doit commencer par l’évaluation des capacités, et non par les commandes d’installation. Le dépôt officiel MiniMax approche les 498 Go, car il contient plusieurs pipelines et composants. Vous n’avez généralement besoin que d’un seul point de contrôle (checkpoint) de diffusion, d’un encodeur de texte correspondant, du VAE vidéo, du VAE audio et d’un workflow. Même une pile réduite peut occuper plusieurs dizaines de gigaoctets avant même de compter les caches, les fichiers temporaires et les vidéos de sortie.
Pour un démarrage simple avec ComfyUI, 24 Go de VRAM constituent une cible pratique pour un modèle de diffusion élagué en INT8, combiné à un encodeur de texte fortement réduit et au déchargement actif. Douze à seize gigaoctets peuvent convenir avec des solutions communautaires GGUF ou d’autres approches quantifiées, mais la configuration devient plus sensible et la génération plus lente. Les affirmations concernant des configurations à 8 Go reposent généralement sur un déchargement massif vers le CPU/RAM et un runtime spécifique : considérez-les comme « capables de démarrer », et non comme « confortables ». Prévoyez une quantité généreuse de RAM système et un espace SSD rapide ; la VRAM n’est pas la seule limite.
Le générateur hébergé MiniMax H3 constitue le test de contrôle le plus rapide. Exécutez-y d’abord la même idée courte. Si le résultat local échoue, vous pourrez distinguer les limites liées au prompt ou au modèle d’un problème d’installation.

Concept de sortie finalisé créé pour ce guide. Le visage, les vêtements, la géométrie du croissant, le contact de l’outil, les étincelles et la disposition de l’atelier forment un test exigeant de qualité pour une première exécution locale.
Traitez les puces Apple Silicon comme un parcours distinct
L’index officiel d’intégration pointe désormais vers une voie expérimentale native Metal pour H3 sur Apple Silicon, mais celle-ci ne suit pas le même chemin opérationnel que la configuration standard CUDA-et-ComfyUI. Ne copiez pas aveuglément les commandes de wheels NVIDIA sur un Mac et n’espérez pas qu’elles fonctionnent. Vérifiez soigneusement la puce prise en charge, la mémoire, les types de workflow et les limitations actuelles du projet choisi, puis effectuez un petit test. Pour une production fiable sur Mac, une solution hébergée peut s’avérer plus rapide que le débogage d’un port local encore immature.
Choisissez la pile et le workflow adaptés
Commencez avec ComfyUI sauf si vous avez besoin d’un contrôle au niveau bibliothèque
ComfyUI constitue la voie locale la plus accessible, car les modèles actuels intègrent déjà le chargeur de modèles, l’encodeur de texte, le VAE, l’échantillonneur, le décodage audio et l’assemblage final de la vidéo. Mettez à jour ComfyUI avant d’importer un modèle H3 ; les anciennes versions stables peuvent ne pas reconnaître les types de nœuds requis. Commencez par un modèle de base sans nœuds personnalisés optionnels. N’ajoutez l’accélération, la mise en cache, l’interpolation ou la mise à l’échelle qu’après avoir obtenu un premier rendu propre et fonctionnel.
Une approche directe via Diffusers ou un script Python personnalisé s’avère utile pour le développement de services ou la recherche, mais elle expose davantage de décisions relatives aux dépendances et au pipeline. L’exemple minimal fourni sur une page d’hébergement de modèles ne reflète pas nécessairement l’intégralité du workflow audio-vidéo. Si votre objectif est un seul clip local, commencez par un workflow maintenu plutôt que de reconstruire chaque composant à partir de noms de fichiers.
Associez FL2VA ou Ref2VA à la tâche à accomplir
FL2VA désigne la famille utilisée pour la génération texte-vers-vidéo, image-vers-vidéo, ainsi que pour le contrôle par première ou dernière image. Ref2VA est une famille différente de points de contrôle destinée aux images de référence, aux vidéos et aux fichiers audio. Charger un workflow Ref2VA avec des poids FL2VA n’est pas une substitution anodine : le graphe attend un itinéraire de conditionnement différent. Le guide Ref2V contre FL2VA explique en détail ce choix.
Pour un premier test, privilégiez la génération texte-vers-vidéo avec FL2VA ou une I2V à partir d’une seule image. Ces options comportent moins d’éléments en interaction. Passez à Ref2VA uniquement une fois que le rendu de base aura confirmé que le runtime, le VAE et la chaîne de sortie fonctionnent correctement.
Téléchargez et placez les fichiers requis
Rédigez un manifeste avant le téléchargement
Notez précisément le nom du fichier workflow et tous les noms de fichiers de modèles qu’il référence. Un manifeste pratique comporte quatre lignes : modèle de diffusion, encodeur de texte, VAE vidéo et VAE audio. Indiquez la précision, la taille du fichier, le dépôt source, le répertoire cible et la somme de contrôle (checksum), si elle est fournie. Cela évite deux erreurs coûteuses : télécharger toutes les variantes disponibles et associer des fichiers qui n’ont pas été conçus pour fonctionner ensemble dans le même graphe.
Pour un package ComfyUI actuel, le schéma de répertoires est le suivant :```text ComfyUI/models/diffusion_models/<H3 diffusion checkpoint> ComfyUI/models/text_encoders/<matching Qwen3-VL text encoder> ComfyUI/models/vae/<MiniMax H3 video VAE> ComfyUI/models/vae/<MiniMax H3 audio VAE>
Le pipeline local open-weight génère des vidéos en 768p ; la régénération hébergée en 2K constitue un service distinct. Ne téléchargez pas un fichier étiqueté « 2K » en supposant que le graphique local standard prendra en charge ce mode de sortie.
### Vérifiez les noms de fichiers avant de lancer l’exécution
Après chaque téléchargement, comparez la taille en octets et la somme de contrôle, puis assurez-vous que le nom du fichier sélectionné dans le sélecteur de workflow correspond exactement au fichier présent sur le disque. Des téléchargements partiels de modèles peuvent toutefois apparaître dans un dossier et échouer ultérieurement avec des erreurs de tenseur ou de désérialisation trompeuses. Nommez clairement les poids de diffusion FL2VA et Ref2VA. Si vous testez plusieurs quantifications, modifiez un seul composant à la fois et enregistrez chaque graphique fonctionnel sous un nom versionné distinct.

*Une image finale rapprochée permet de vérifier si la configuration locale préserve l’identité du personnage, le contact main-objet, la géométrie de l’outil et la forme de la sculpture, même lorsque la distance caméra change.*
## Importez le workflow et générez un rendu de référence
### Chargez d’abord, puis résolvez les nœuds rouges
Ouvrez le modèle officiel dans une installation mise à jour de ComfyUI. Si des nœuds apparaissent en rouge ou sont inconnus, arrêtez l’exécution et déterminez s’ils appartiennent au cœur actuel de ComfyUI ou à un package personnalisé documenté. N’installez pas systématiquement tous les nœuds suggérés par un gestionnaire. Redémarrez l’application après toute modification des packages requis, puis rouvrez le modèle et sélectionnez les quatre fichiers manifestes dans leurs chargeurs respectifs.
Définissez une durée courte, une résolution paysage conservatrice, les paramètres d’échantillonnage standards fournis dans le modèle, ainsi qu’une invite simple. Évitez les LoRAs, les packs de références, les outils d’augmentation de résolution, l’interpolation de trames et les invites longues ou multi-scènes. Vos premiers critères d’acceptation sont mécaniques : l’invite est bien mise en file d’attente, le modèle est chargé une seule fois, l’échantillonnage progresse correctement, la vidéo et l’audio sont décodés, le fichier MP4 final est lisible, et une deuxième exécution ne déclenche ni nouveau téléchargement ni recompilation inattendue.
### Utilisez une seule invite mettant en évidence les échecs courants
Essayez une scène où un sujet réalise une action physique précise dans un lieu bien éclairé et accompagné d’un événement sonore audible : « Un forgeron vêtu d’une chemise indigo et d’un tablier beige frappe une seule fois une sculpture en forme de croissant ; des étincelles jaillissent vers la gauche, puis il la baisse lentement vers une cuve de trempe ; lumière vive d’atelier, visage et mains stables, impact net du marteau et vapeur visible. » Cette invite révèle l’identité du personnage, la géométrie des objets, le contact, le mouvement, l’éclairage et le son, sans pour autant former une narration complète.
```official-video
src=https://r2.seedance.tv/blog/minimax-h3-first-and-last-frame/official-flf-output-v1.mp4
poster=https://r2.seedance.tv/blog/minimax-h3-first-and-last-frame/official-flf-poster-v1.png
label=MiniMax H3 first-and-last-frame output sample
Un extrait final H3 permet de vérifier si le graphique local produit un mouvement réel, une transition cohérente et un fichier final lisible complet — et non simplement des images isolées.
Corrigez les échecs locaux les plus fréquents
Diagnostiquez selon la phase d’échec
Une erreur de mémoire insuffisante (OOM) survenant pendant le codage du texte pointe vers l’encodeur textuel ou sa stratégie de déchargement ; une erreur survenant pendant l’échantillonnage concerne plutôt le modèle de diffusion, la taille des latents, la durée, l’implémentation de l’attention ou le comportement de déchargement ; une erreur survenant lors du décodage implique le VAE vidéo/sonore et la marge mémoire disponible. Notez le dernier nœud exécuté avec succès, plutôt que d’interpréter chaque plantage comme un simple manque de VRAM. Réduisez d’abord la durée et la résolution, fermez les applications GPU concurrentes, et testez une quantification connue pour être compatible.
Si un VAE ne se charge pas, vérifiez que les fichiers vidéo et audio sont bien placés dans models/vae, qu’ils sont complets et qu’ils sont sélectionnés par le chargeur approprié. Si la vidéo finale est muette, assurez-vous que le VAE audio a bien décodé la portion audio du latent joint, et que le nœud final de vidéo a multiplexé correctement les deux flux. Le guide de vitesse VAE H3 et TensorRT aide à distinguer les goulots d’étranglement liés au décodage de ceux liés à la vitesse d’échantillonnage.

La vapeur, le contact eau-métal, les pinces, le visage et la forme de la croissant constituent un point de contrôle plus exigeant en matière de mouvement et de décodage, une fois que le simple coup de marteau a été validé.
Ajoutez les optimisations une par une
Une fois le rendu de référence fonctionnel, dupliquez le workflow avant d’y intégrer une LoRA Turbo, SageAttention, la mise en cache de blocs, une autre quantification ou un chemin personnalisé vers un VAE. Modifiez une seule variable à la fois et relancez l’exécution avec la même graine (seed) et la même invite. Enregistrez la consommation maximale de VRAM, le temps réel écoulé (wall time), la taille du fichier de sortie, les artefacts visibles et la qualité audio. Une accélération en quatre étapes peut altérer la fluidité des mouvements rapides ou la fidélité sonore ; la vitesse n’a de sens que si la séquence passe toujours les contrôles de validation.
Transformez un graphique fonctionnel en workflow de production
Versionnez conjointement le graphique, l’environnement et les sorties
Enregistrez le fichier JSON du workflow fonctionnel accompagné d’un manifeste contenant le commit de ComfyUI, les commits des nœuds personnalisés, les versions de Python, PyTorch, CUDA, le modèle GPU, les hachages des modèles, la graine (seed), les dimensions, la durée et les paramètres de l’échantillonneur. Exportez séparément un workflow au format API si vous comptez l’envoyer via /prompt ; le JSON de l’éditeur et le JSON API ne sont pas interchangeables. Conservez les aperçus, les fichiers MP4 finaux et les journaux (logs) sous le même identifiant de tâche.
Pour les récits plus longs, utilisez des blocs courts et faites progresser les points de terminaison validés. Le workflow multi-cléframe couvre les repères visuels intermédiaires, tandis que le workflow multiscène reprise possible montre comment les points de sauvegarde empêchent un échec survenu près de la fin de redémarrer l’intégralité du travail.
title=Guide de configuration locale H3 description=Guide étape par étape pour configurer, valider et optimiser le pipeline local H3, y compris la gestion des modèles, le dépannage des échecs courants et la mise à l’échelle vers la production. tags=H3,local setup,video generation,diffusion models,ComfyUI,minimax
Une sortie H3 de référence terminée et distincte, destinée à l’évaluation de l’identité, de l’influence de la référence, du comportement de la caméra, de l’audio natif et du fichier final multiplexé, une fois le chemin FL2VA de base stabilisé.
Choisissez H3 local ou Seedance Agent
Conservez le contrôle local lorsque cela crée une réelle valeur
L’option H3 local s’impose lorsque les fichiers de modèle doivent rester sur votre machine, que vous avez besoin de nœuds personnalisés ou de quantifications expérimentales, que vous êtes en mesure de maintenir un environnement GPU, et que le temps d’itération est acceptable. Elle vous donne un accès direct au JSON du workflow, aux graines (seeds), aux états intermédiaires et aux points de terminaison d’automatisation. Ce contrôle est précieux pour la recherche et les pipelines spécialisés, mais implique un engagement continu en matière de maintenance.
Seedance Agent convient aux équipes souhaitant utiliser H3 sans faire de la compatibilité des pilotes, du stockage, du déchargement (offloading), des versions des nœuds ou de la reprise après erreur (render recovery) un projet à part entière. Il permet de traduire une consigne brève en un plan de planification (shot plan) consultable, de conserver les rôles de référence et les critères d’acceptation associés à chaque plan, de présenter les sorties finales, et de relancer uniquement la séquence faible après validation.

La dernière image vérifie si l’identité, les vêtements, la disposition de l’atelier et la géométrie du croissant résistent à toute la séquence locale, depuis l’impact initial jusqu’à l’objet final.
Conclusion
Une configuration locale MiniMax H3 fiable commence par le choix de la famille de tâches appropriée, et non par le téléchargement de tous les éléments étiquetés H3. Vérifiez la compatibilité matérielle et la capacité de stockage, mettez à jour ComfyUI, associez un point de contrôle (checkpoint) de diffusion à son encodeur de texte correspondant ainsi qu’aux deux VAE, placez les fichiers dans les dossiers attendus, et exécutez un rendu de base court avant d’ajouter l’accélération ou des références complexes. Versionnez chaque combinaison fonctionnelle afin qu’un nouveau nœud ou une nouvelle quantification ne puisse pas effacer une configuration éprouvée. Si le contrôle local importe moins que la planification, la revue, la continuité et une production reprise facilement en cas d’erreur, démarrez le projet avec Seedance Agent et utilisez MiniMax H3 sans avoir à maintenir l’ensemble de la pile vous-même.
Prêt à essayer par vous-même ?
Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Articles associés
D'autres articles dans la même langue à lire ensuite.

Référence Vidu vers vidéo : formule, exemples et corrections de cohérence
Découvrez une formule reproductible pour les invites Vidu référence-vers-vidéo, copiez des exemples pratiques, attribuez de 1 à 7 images de référence, et corrigez les dérives de personnage, de produit et de scène.
Lire l'article
Générateur vidéo Qwen IA gratuit : guide d’accès, de test et d’exportation
Découvrez où accéder aux outils vidéo Qwen, vérifiez les limites gratuites, testez la génération vidéo à partir de texte et d’images, examinez les exports disponibles, puis transférez une idée validée vers Seedance Agent.
Lire l'article
Générateur vidéo IA SnapGen gratuit : testez-le avant de vous engager
Découvrez comment vérifier l’accès gratuit à SnapGen, tester la génération vidéo à partir de texte et d’images, examiner les exports et les coûts, puis intégrer un concept validé dans Seedance Agent.
Lire l'article