Meilleurs paramètres MiniMax H3 pour la qualité, la vitesse et l’audio en 2026

E
Emma Chen·7 min de lecture·Aug 18, 2026
Partager sur X
Meilleurs paramètres MiniMax H3 pour la qualité, la vitesse et l’audio en 2026

Aperçu IA

Quels sont les meilleurs paramètres pour la qualité vidéo MiniMax H3 ?

Utilisez une résolution de 1344×768 au format 16:9, res_multistep, le planificateur simple, 20 étapes de débruitage, un guidance de 1, un décalage vidéo de 12 et un décalage audio de 3. Il s’agit de la référence ouverte fiable en matière de qualité.

Combien d’étapes dois-je utiliser pour MiniMax H3 dans ComfyUI ?

Utilisez 20 étapes avec res_multistep pour un rendu de qualité. N’utilisez que 4 à 8 étapes avec une LoRA Turbo compatible lorsque la rapidité des itérations prime sur le niveau maximal de détail.

Quelle résolution MiniMax H3 produit-elle localement par rapport à celle fournie via l’API ?

Les poids locaux publiés ciblent la résolution 768p, typiquement 1344×768 au format 16:9. Le service hébergé H3 peut fournir une sortie de résolution supérieure, notamment grâce à son pipeline intégré Regenerate-2K.

Prêt à essayer par vous-même ?

Crédits offerts à l'inscription. Forfaits à partir de $20/mois.

Essayer Seedance gratuitement

Comment contrôler l’audio dans MiniMax H3 ?

Nommez chaque son, voix ou instrument, et précisez le moment où il intervient. Conservez la piste stéréo native à 32 kHz, utilisez un décalage audio de 3 comme référence publiée, et simplifiez les indices concurrents si un décalage temporel apparaît entre vidéo et audio.

Pourquoi les paramètres MiniMax H3 diffèrent-ils de ceux des autres modèles vidéo

MiniMax H3 ne se comporte pas comme un modèle de diffusion classique avec un CFG autour de 7,5. Il est « guidance-distilled », donc le guidance 1 est la valeur prévue ; l’augmenter peut durcir les contours, déstabiliser le mouvement ou dégrader le résultat. En outre, H3 génère simultanément vidéo et audio stéréo, chacun disposant d’un calendrier sigma distinct.

Le nombre d’images suit une grille 17n+5 à 24 images/seconde. Une séquence locale pratique de cinq secondes compte 124 images, tandis que les cibles plus longues doivent être arrondies à un nombre valide plutôt que saisi arbitrairement. Ces trois règles — guidance 1, décalages vidéo/audio distincts et grille d’images — constituent la base de tous les paramètres décrits ci-dessous. Si vous souhaitez obtenir le graphe complet en premier lieu, consultez le guide de configuration MiniMax H3 pour ComfyUI.

Paramètres de résolution — explication des formats 768p, 1080p et 2K

La résolution doit correspondre à la phase de travail. Les poids ouverts locaux atteignent leur limite à la classe 768p ; 1344×768 constitue la toile standard 16:9 et avoisine le million de pixels. Une toile de 0,5 MP est utile pour vérifier la composition et la direction du prompt. La sortie hébergée supprime la contrainte mémoire locale et ajoute le chemin de régénération haute résolution.

Cible Paramètre typique Meilleur usage Compromis
Aperçu local Environ 0,5 MP Tests de prompt et de mouvement Plus rapide, détails moins nets
Qualité locale 1344×768 au format 16:9 Rendu local final Taille maximale publiée localement
1080p hébergé Préréglage du service Réseaux sociaux, publicités, révision client Plus de détails sans consommation de VRAM locale
2K hébergé Regenerate-2K Diffusion commerciale, petits textes, recadrages Coût et temps de traitement les plus élevés

La décision est simple : itérez à 0,5 MP, validez à 768p, puis n’utilisez le 2K hébergé que pour la prise retenue. La séquence officiellement générée par H3 ci-dessous constitue un bon test de qualité : examinez la texture de la peau, les mains, les piétons en arrière-plan, les enseignes de café et la continuité audio, plutôt que de juger une image fixe isolée.

MiniMax H3 · scène de café officiellement générée avec audio natif

Étapes, échantillonneur et planificateur — la référence fonctionnelle

Pour les flux de travail actuels dans ComfyUI, la référence la plus utile consiste en res_multistep, le planificateur simple et 20 étapes de débruitage. Certains nœuds exposent cela comme 21 points sigma, car 21 points produisent 20 passages avant DiT. Ne définissez pas accidentellement ces deux valeurs à 20 sans vérifier ce que signifient les étiquettes des nœuds.

Objectif Échantillonneur Planificateur Étapes Quand l’utiliser
Référence qualité res_multistep simple 20 Rendu local final et comparaisons
Itération rapide Chemin compatible Turbo simple 4–8 Tests de prompt, de mouvement et de cadrage
Reproduction ancienne Euler Calendrier publié 49–50 appels Correspondance exacte d’un ancien flux de travail

Turbo n’est pas un interrupteur universel « moins d’étapes » ; il nécessite un adaptateur et un graphe compatibles. Commencez à 4 étapes pour la mise en page, passez à 6–8 étapes lorsque les visages ou les mouvements fins exigent plus de stabilité, et comparez avec une référence à 20 étapes avant livraison finale. Le guide MiniMax H3 Turbo LoRA indique le placement correct du chargeur, tandis que le guide d’entraînement LoRA couvre les adaptateurs de style personnalisés.

Échelle de guidance, décalages et paramètres audio

Conservez le guidance à 1. H3 intègre déjà le guidance dans les poids publiés, donc des valeurs élevées de CFG n’améliorent pas l’obéissance au prompt comme cela pourrait être le cas pour d’anciens modèles d’image. Pour le calendrier open-weight publié, utilisez conjointement un décalage vidéo de 12 et un décalage audio de 3. Certains graphes communautaires exposent un décalage audio de 4 ; conservez cette valeur uniquement pour reproduire exactement ce flux de travail précis, et revenez à 3 si les voix, les battements ou les effets dérivent temporellement.

Les prompts audio donnent les meilleurs résultats lorsqu’ils nomment une source et un instant précis : une tasse en céramique touche la table à 00:03, ambiance routière douce en continu, ou un pas sec sur la première marche. Évitez de demander des dialogues, de la musique, du bruit de foule, des conditions météorologiques ou plusieurs effets dans la même séquence de cinq secondes. Pour une meilleure structure des phrases et un langage temporel plus précis, consultez le guide de prompting MiniMax H3.

MiniMax H3 · exemple officiel de générique de film

Feuille de triche des paramètres ComfyUI

Paramètre Qualité d’abord Vitesse d’abord
Mégapixels 1,0 (1344×768) 0,5 pour l’aperçu
Étapes 20 4–8 avec Turbo LoRA
Échantillonneur res_multistep Échantillonneur compatible Turbo
Planificateur simple simple
Guidance 1 1
Décalage vidéo 12 12
Décalage audio 3 3
Images Nombre valide de la forme 17n+5 Test valide le plus court
Graine Fixe pour les tests A/B Aléatoire pour l’exploration

Modifiez une seule ligne à la fois. Conservez la graine fixe lors de la comparaison de la résolution, du nombre d’étapes ou des décalages ; sinon, vous comparez différentes générations plutôt que des paramètres. Lorsque vous souhaitez un résultat sans télécharger de points de contrôle ni ajuster un graphe, générez avec Seedance en utilisant des préréglages optimisés →.

Paramètres pour chaque mode — T2V, I2V, FLF2V et Ref2VA

Mode Chemin du modèle Éléments à verrouiller Priorité des paramètres
T2V FL2VA Prompt et graine Composition d’abord, puis mouvement et son
I2V FL2VA Première image et rapport d’aspect Adapter la toile latente à l’image d’entrée
FLF2V FL2VA Première et dernière images Adapter les deux extrémités ; ne décrire que le parcours dans le prompt
Ref2VA Ref2VA Identité de référence et ordre Allouer uniquement les références nécessaires à la prise

Le mode T2V dépend entièrement de la structure du prompt : définissez donc successivement le sujet, l’action, la caméra, l’environnement et l’audio. Le mode I2V hérite sa composition de la première image ; modifier le rapport d’aspect entraîne des recadrages évitables. Le mode FLF2V verrouille les deux extrémités, aussi réduisez le prompt au mouvement, au timing, au trajet de la caméra et au son. Le guide « première et dernière image » inclut la préparation d’images compatibles ainsi que des corrections de transition.

Ref2VA prend en charge un budget contextuel plus riche — jusqu’à neuf images, trois vidéos et trois références audio dans les flux de travail pris en charge — mais « maximum » n’est pas un objectif. Utilisez, si possible, une ou deux images d’identité, une vidéo de mouvement et une référence audio propre. Des entrées supplémentaires se font concurrence pour l’attention et rendent le débogage plus difficile.

Conclusion

Rappelez-vous la référence MiniMax H3 comme suit : 768p, 20 étapes, res_multistep, simple, guidance 1, décalages 12/3 ; utilisez uniquement les rendus Turbo de 0,5 MP et 4–8 étapes pour l’itération, puis transférez la version retenue vers une résolution hébergée de 2K lorsque le détail final est essentiel. Associez FL2VA ou Ref2VA au mode approprié, maintenez les nombres d’images sur la grille 17n+5, décrivez les sources audio avec leurs timings, et modifiez un seul paramètre à la fois.

Prêt à essayer par vous-même ?

Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.

Crédits offerts à l'inscription. Forfaits à partir de $20/mois.