MiniMax H3 – Instructions pour micro-expressions : émotions subtiles et naturelles, directes

E
Emma Chen·11 min de lecture·Sep 10, 2026
Partager sur X
MiniMax H3 – Instructions pour micro-expressions : émotions subtiles et naturelles, directes

AI Overview

Comment rédiger un prompt de microexpression MiniMax H3 ?

Nommez l’émotion, les indices faciaux visibles, le déclencheur et le moment où l’expression s’installe. Utilisez un seul changement mesuré — par exemple, un adoucissement du regard et une détente de la mâchoire — plutôt qu’une accumulation de termes émotionnels spectaculaires.

Pourquoi un personnage H3 apparaît-il vide ou robotique ?

Le prompt peut décrire un ressenti intérieur sans action observable, ou exiger trop de signaux contradictoires. Donnez au visage une cause claire, une seule réaction lisible, des clignements et une respiration naturels, puis précisez un état de repos neutre.

MiniMax H3 peut-il reproduire une expression à partir d’une référence ?

Le mode référence peut exploiter des images ou des vidéos pour transmettre l’identité et les signaux de performance. Attribuez à chaque fichier un rôle explicite, distinguez clairement l’identité faciale de la référence d’interprétation, et vérifiez que le transfert d’expression ne remplace pas le personnage.

Faut-il associer dialogue et réactions faciales dans un même prompt ?

Oui, lorsque la réaction est liée à une réplique ou à une pause précise. Placez l’expression avant, pendant ou après le battement vocal, assurez la compatibilité entre le mouvement buccal et les mots prononcés, et évitez toute direction caméra simultanée contradictoire.

Ce que contrôle réellement un prompt de microexpression

Un prompt de microexpression doit diriger un changement mineur perceptible progressivement par le spectateur. « Elle se sent nerveuse » est une indication d’interprétation, mais ne précise pas au modèle quel signal porte concrètement cette émotion. « Ses sourcils internes se soulèvent légèrement, elle serre brièvement les lèvres, puis expire et relâche sa mâchoire » fournit une séquence d’actions observables. Cette deuxième formulation est plus facile à mettre en scène, à évaluer et à réviser.

MiniMax H3 accepte du texte, des images, des vidéos et de l’audio comme contexte, et ses documents officiels décrivent des sorties de quatre à quinze secondes à 24 images par seconde. Cela suffit pour qu’un battement facial émerge, atteigne son apogée et s’installe, mais pas pour un arc émotionnel complexe accompagné de plusieurs mouvements de caméra. Traitez le prompt comme un brief de plan compact : personnage, déclencheur, réponse visible, caméra, son et fin.

Une femme sur un quai baigné de pluie, exprimant à la fois du soulagement et de l’inquiétude

La cible utile n’est pas « un visage triste », mais une combinaison lisible : yeux humides, mâchoire commençant à se détendre, lèvres maîtrisées et regard restant alerte.

Ici, « microexpression » désigne un terme de direction créative, non un outil clinique de détection des émotions. Utilisez de petits indices visibles pour communiquer un sentiment scénique tout en préservant l’identité, l’anatomie et la synchronisation labiale.

Construire l’expression comme un battement temporel

Commencez par une ligne de base neutre. Sans cela, le modèle risque de démarrer à intensité maximale, sans possibilité d’évolution. Ensuite, indiquez le déclencheur : un train quitte le quai, un nom est annoncé, un message se termine, ou un autre personnage fait une pause. Choisissez ensuite deux ou trois signaux faciaux compatibles. Terminez en décrivant le nouvel état de repos. Cela forme un battement en quatre parties, réutilisable dans presque tout prompt H3 :

  1. Ligne de base : visage composé, regard fixe, épaules détendues.
  2. Déclencheur : elle entend la réponse hors-champ après une courte pause.
  3. Réponse : son regard s’adoucit, ses paupières inférieures se soulèvent légèrement, et un coin de sa bouche esquisse presque un sourire.
  4. Installation : elle expire discrètement et retrouve un calme professionnel, avec une pointe d’inquiétude encore perceptible dans son regard.

Évitez de donner une instruction distincte pour chaque trait du visage. Une liste séparée de consignes concernant les sourcils, les yeux, le nez, la mâchoire, les lèvres et le sourire est souvent contradictoire. Privilégiez une seule transition, et laissez la respiration, la posture et le regard la soutenir. Les clignements naturels fonctionnent mieux comme ponctuation occasionnelle, non selon un calendrier mécanique.

Un candidat à un emploi tentant de masquer sa nervosité devant un entretien

Pour une tension maîtrisée, examinez les relations entre les sourcils, la pression des lèvres, la prise et la posture. Le visage ne doit pas basculer brusquement vers une peur théâtrale.

La distance de la caméra détermine si le spectateur peut percevoir le signal. Utilisez un gros plan ou un plan moyen rapproché pour capturer les modifications des paupières, des coins de la bouche et de la mâchoire. Si vous avez besoin d’un plan large d’ensemble, zoomez sur le visage avant l’apogée émotionnelle ou utilisez un plan séparé. Le guide MiniMax H3 « visages à distance » traite les cas où le visage est trop petit pour porter fiablement la performance.

Quatre modèles de prompts de microexpression prêts à copier

Ces modèles sont des schémas de production récemment rédigés, non des sorties H3 officielles revendiquées. Remplacez les détails narratifs entre crochets et conservez la séquence d’observations. Chaque modèle demande un seul battement de performance dominant.

Nervosité dissimulée : « Plan moyen rapproché de [personnage] attendant devant [lieu]. Le visage commence dans un état composé. Après avoir entendu [déclencheur], les sourcils internes se soulèvent légèrement et les lèvres se serrent pendant moins d’une seconde. Une respiration superficielle soulève la poitrine ; les doigts se détendent autour de [objet]. L’expression s’installe dans un calme délibéré. Clignements naturels, pas de grimace, pas de peur exagérée. La caméra reste fixe. »

Soulagement teinté d’inquiétude : « Gros plan de [personnage] lisant [résultat]. Les yeux s’éclairent d’abord, les épaules se détendent et un léger sourire semble naître. Puis le regard revient vers [sujet hors-champ], gardant une trace d’inquiétude dans les paupières inférieures. Une expiration discrète. Fin sur une contenance professionnelle maîtrisée, non sur une célébration. »

Un chef qui manifeste une légère déception en goûtant une soupe

*Un prompt pratique nomme le déclencheur (la dégustation) et une réponse brève — yeux légèrement plissés, tension nasale et lèvres maîtrisées — avant que le chef ne revienne à la résolution du problème.*Déception privée : « Gros plan serré sur [personnage] goûtant ou examinant [objet]. Pendant une brève seconde, les narines se resserrent et les yeux se plissent, tandis que la bouche reste fermée. Le personnage perçoit sa propre réaction, respire par le nez, puis reporte son regard sur la tâche avec une détermination concentrée. Pas de grimace de dégoût, pas de mouvement brusque de la tête, pas d’effet comique. »

Réaction d’écoute pendant un dialogue : « Gros plan en contre-plongée sur l’épaule de [auditeur], tandis que [interlocuteur] prononce la dernière phrase hors champ. L’auditeur maintient le contact visuel, cligne une fois des yeux après le mot-clé, et un coin de la bouche s’élève légèrement, tandis que les yeux restent tristes. Attendre une demi-seconde avant la réponse. Garder la respiration et les mouvements de tête subtils ; préserver la synchronisation labiale pour la réponse. »

Ne collez pas les quatre exemples dans une seule demande. Choisissez le travail émotionnel ciblé, adaptez le déclencheur et supprimez tout langage inutile. Si le clip contient un dialogue parlé, écrivez la réplique et la réaction dans l’ordre de lecture. La page consacrée à la cohérence vocale propose une méthode d’analyse utile pour aligner performance vocale et visuelle entre plans, même lorsque votre modèle de génération diffère.

Choisir le mode et les rôles de référence

La génération texte-vers-vidéo demande à H3 d’inventer la personne, le décor et la performance : décrivez donc l’apparence uniquement à hauteur de ce qui permet de garder l’acteur identifiable. Dans la génération image-vers-vidéo à partir de la première image, le visage et la composition initiaux sont déjà définis ; consacrez l’espace du prompt aux mouvements, au timing des expressions, au regard et aux éléments devant rester inchangés. Le mode « première et dernière image » est utile lorsque l’émotion finale doit précisément coïncider avec une image donnée, mais la transition nécessite tout de même un déclencheur crédible et un parcours maîtrisé.

La génération référence-vers-vidéo est pertinente lorsque les signaux proviennent d’actifs séparés. Attribuez explicitement des rôles : Picture 1 gère l’identité faciale, Picture 2 la tenue vestimentaire, Video 1 fournit la performance d’écoute maîtrisée, et Audio 1 définit le timbre vocal. Précisez que les mouvements d’interprétation et leur timing sont transférés sans remplacer l’identité de la personne cible.

Un médecin lisant un résultat puis retrouvant sa contenance professionnelle

Une émotion mixte devient lisible lorsque le prompt définit clairement l’ordre des indices : les yeux s’éclairent, les épaules se détendent, un sourire naissant apparaît, puis la contenance revient.

Consultez le guide décisionnel Ref2V versus FL2VA avant d’attacher des supports médias. Plus de références ne signifie pas automatiquement meilleur résultat. Des angles de visage concurrents, des pics d’expression divergents ou des conditions d’éclairage incompatibles peuvent affaiblir le signal. Pour un portrait simple, une seule image forte d’identité et une seule référence d’interprétation ciblée sont souvent plus simples à diagnostiquer qu’un dossier rempli de fichiers similaires.

Corriger les visages vides, robotiques ou surexagérés

Un visage vide signifie généralement que le prompt décrit l’humeur, mais pas l’évolution. Ajoutez un déclencheur et deux indices visibles. Un visage robotique associe souvent un regard fixe, un clignement parfaitement synchronisé et une tête immobile ; rétablissez une respiration naturelle, un léger ajustement du regard et une asymétrie. Un visage surexagéré provient fréquemment d’intensificateurs répétés comme « extrêmement terrifié, choqué et anéanti ». Remplacez-les par une seule transition maîtrisée et une limite négative : pas de grimace, pas d’yeux exorbités, pas de mouvement brusque de la tête.

Si la bouche bouge de façon étrange, distinguez clairement la réaction silencieuse de la parole. Laissez l’auditeur réagir pendant la réplique de l’autre personne, faites une pause, puis livrez une brève réponse. Si l’identité change au pic de l’émotion, réduisez le déplacement caméra, renforcez la référence d’identité et simplifiez l’expression. Si le résultat ignore des formulations subtiles, vérifiez l’encodeur texte/vision et le chemin de référence ; le guide de précision de l’encodeur Qwen explique comment comparer des prompts sémantiques complexes sans confondre la quantification avec un autre changement de flux de travail.

MiniMax H3 exemple de mouvement référence-vers-vidéo

Cet exemple existant de génération référence-vers-vidéo avec H3 est destiné à l’inspection, non à servir de référence pour les microexpressions. Analysez l’ensemble du mouvement pour évaluer la stabilité de l’identité, le regard, le rythme des clignements et la naturalité du retour au repos facial.

Lors des tests, conservez inchangés l’entrée, la graine (seed), la durée, le modèle, la résolution et l’instruction caméra. Modifiez une seule formulation d’expression à la fois. Une séquence utile en trois essais consiste en un essai de référence, un essai avec instruction réduite, puis un essai avec un déclencheur clarifié. Si le prompt raccourci fonctionne, ajoutez uniquement le détail indispensable à l’histoire, plutôt que de réintégrer l’ensemble de la pile originale.

Examiner la performance complète en production

Validez l’émotion en mouvement, et non à partir d’une image figée flatteuse. Regardez à vitesse normale avec le son, puis en mode muet pour juger du timing, et en audio seul pour évaluer le rythme vocal. Vérifiez l’identité, le regard, le rythme des clignements, l’articulation buccale, les mouvements de tête, la tension des épaules, ainsi que la proximité de la caméra durant le moment clé.

Un père âgé écoutant un message vocal, mêlant joie et tristesse

Une émotion mixte ne requiert pas nécessairement une expression dramatique : des yeux adoucis, un mouvement asymétrique de la bouche et une respiration calme suffisent à porter la scène.

Pour une scène multi-plan, rédigez un transfert d’état émotionnel après chaque prise validée : « méfiant avant l’appel », « un soulagement commence après l’énoncé du nom », « calme, mais toujours incertain ». Enregistrez la référence choisie, le prompt, la graine et la note d’acceptation avec chaque plan. Seedance Agent peut organiser ces références, planifier le gros plan au bon moment, centraliser les décisions des relecteurs et relancer uniquement le segment de performance défaillant, plutôt que de régénérer toute la séquence.Utilisez la page du modèle MiniMax H3 lorsque vous souhaitez intégrer le modèle et le mode dans un flux de travail hébergé unique, ou commencez depuis l’espace de travail image-vers-vidéo lorsque le portrait d’un acteur est déjà fortement défini. L’objectif créatif reste identique : une légère modification faciale motivée, qui soutient le récit sans attirer l’attention sur le processus de génération.

Conclusion

Des invites efficaces pour les microexpressions MiniMax H3 traduisent un sentiment intérieur en une courte séquence visible : état neutre de référence, déclencheur clair, deux ou trois indices faciaux et corporels compatibles, et retour contrôlé à un état de repos. Rapprochez suffisamment la caméra, attribuez à chaque référence un rôle précis, placez les réactions autour des dialogues dans l’ordre de lecture, et supprimez toute instruction exagérée ou contradictoire. Revoyez l’intégralité de la séquence avec et sans son, notez l’état émotionnel retenu entre les prises, et révisez une phrase à la fois. Lorsque la gestion des références, le calage temporel, les validations et les réexécutions partielles deviennent les problèmes les plus complexes, construisez le flux de travail de performance avec Seedance Agent et maintenez l’attention sur le moment finalisé de l’acteur.

Prêt à essayer par vous-même ?

Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.

Crédits offerts à l'inscription. Forfaits à partir de $20/mois.