- Blog
- Tutorial de Midjourney Animate para imágenes subidas: de fotograma fijo a video utilizable
Tutorial de Midjourney Animate para imágenes subidas: de fotograma fijo a video utilizable

Resumen de IA
¿Puede Midjourney animar una imagen subida desde tu ordenador?
Sí. Sube la imagen en la barra web Imagine, colócala en la ranura Animate y luego elige animación manual o automática. La imagen subida se convierte en el primer fotograma de un vídeo de cinco segundos.
¿Deberías elegir Low Motion (Baja movilidad) o High Motion (Alta movilidad)?
Empieza con Low Motion para retratos, productos, arquitectura y otras tomas donde preservar fielmente la fuente sea lo más importante. Usa High Motion cuando el movimiento visible del sujeto o un desplazamiento de cámara más marcado justifiquen un mayor riesgo de distorsión.
¿Qué debe describir un prompt de imagen a vídeo en Midjourney?
Describe el cambio a lo largo del tiempo: acción del sujeto, movimiento ambiental, comportamiento de la cámara, ritmo y el fotograma final deseado. Evita repetir todos los detalles visuales ya fijados en la imagen subida.
¿Cuánto tiempo puede durar un vídeo animado?
La primera generación dura cinco segundos. Cada extensión añade cuatro segundos, y un clip puede ampliarse hasta cuatro veces, alcanzando un máximo de 21 segundos; por tanto, aprueba cada segmento antes de invertir en el siguiente.
Prepara la imagen subida antes de animarla
El fotograma fuente realiza la mayor parte del trabajo de continuidad. Una imagen limpia brinda al modelo de vídeo un sujeto estable, una profundidad legible y menos detalles ambiguos que deba inventar. Antes de subirla, inspecciona el rostro, las manos, los patrones repetitivos, la tipografía, la geometría fina del producto, los reflejos y los objetos que se superpongan al borde del encuadre. Un defecto que parece menor en una imagen estática puede convertirse en un artefacto móvil distractor.
Encuadra para el formato final antes de la generación. Deja espacio para el movimiento en la dirección en que debe desplazarse el sujeto, evita cortar articulaciones justo en el borde y mantén los objetos importantes suficientemente separados para preservar sus formas. Un retrato que girará debe mostrar suficiente hombro y contexto de fondo para que el modelo infiera la profundidad. Una presentación de producto requiere margen alrededor de la silueta, de modo que un acercamiento (push-in) no recorte prematuramente el objeto.

Un fotograma inicial útil presenta un único sujeto claro, una dirección de movimiento legible y suficiente entorno para que la cámara se desplace sin tener que inventar la escena.
Si una única referencia debe soportar varias tomas, fija las decisiones creativas antes de la animación: apariencia del sujeto, vestuario, ubicación, hora del día, sensación de lente y tratamiento del color. Conserva la fuente aprobada junto a cada resultado. Para una secuencia más larga, planifica las referencias y los roles de las tomas antes de generar el movimiento, para que un buen fotograma no se convierta en cinco clips sin relación entre sí.
Sube la imagen y elige la ruta de animación adecuada
Usa la ranura Animate web para tu propia imagen
En el sitio web de Midjourney, abre el panel de imágenes desde la barra Imagine, sube o selecciona tu archivo y arrástralo a la sección Animate. Esto difiere de adjuntar el archivo como Image Prompt, Style Reference o Edit Model Reference; esos tipos de referencia no son la entrada de fotograma inicial para vídeo. Fija la imagen si deseas probar varios prompts de movimiento a partir de la misma fuente.
Elige una opción automática cuando necesites una interpretación rápida. Elige Animate Manually cuando la toma tenga una acción específica, un movimiento de cámara definido o un punto de detención. Normalmente, la animación manual es la ruta de producción preferible, porque genera una instrucción escrita que puedes revisar, en lugar de modificar varias variables simultáneamente.
La ruta de Discord de Midjourney también acepta una URL de imagen alojada externamente al inicio de un prompt, seguida opcionalmente de texto de movimiento y el parámetro --video. La ruta web resulta más sencilla para la mayoría de los archivos subidos, pues hace explícito el rol del fotograma inicial.
Mantén la primera prueba económica
Los prompts de vídeo generan cuatro variantes de forma predeterminada. Si estás validando un nuevo fotograma fuente o una idea de movimiento incierta, reduce el lote a uno mediante --bs 1. Así, la primera ejecución se convierte en una prueba enfocada, en vez de pagar por cuatro clips que repitan el mismo error de encuadre. Aumenta el tamaño del lote solo tras confirmar que el prompt y el fotograma fuente son sólidos. La guía relacionada Configuración del tamaño de lote para vídeos de Midjourney explica cuándo tiene sentido generar una, dos o cuatro salidas.
Escribe un prompt de movimiento que añada tiempo, no una segunda imagen
Un prompt de movimiento útil es una instrucción concisa de toma. Indica quién o qué se mueve, cómo responde el entorno, qué hace la cámara y dónde se asienta el golpe final (beat). La imagen subida ya define el vestuario, la arquitectura, la paleta y la composición, por lo que repetir esos sustantivos puede desplazar la instrucción temporal.
Usa este patrón listo para copiar:
[acción del sujeto], [movimiento ambiental secundario], cámara [movimiento o posición fija], [ritmo], terminando en [golpe final] --motion low|high --raw --bs 1
Para el fotograma de la calle de tranvía bajo la lluvia, una prueba controlada podría ser:
Ella da dos pasos deliberados y mira hacia el tranvía, una ligera lluvia flota alrededor del paraguas, la cámara mantiene un plano medio estable, movimiento natural contenido, terminando cuando el tranvía frena detrás de ella --motion low --raw --bs 1
La acción es medible: dos pasos, una mirada, un golpe de llegada. La instrucción para la cámara es explícita. El final orienta al modelo en lugar de pedirle un movimiento indefinido. --raw puede hacer que la instrucción escrita de movimiento tenga más influencia al reducir la interpretación creativa adicional, pero no garantiza una coreografía literal.
Para prompts que requieran una transición física más contundente, describe una acción dominante antes de añadir la atmósfera. «Gira mientras pasa el tranvía» es más fácil de evaluar que un párrafo que incluya un giro, una carrera, un zoom, una órbita, una ráfaga de lluvia, un cambio de vestuario y una reacción de la multitud. Cuando necesites trasladar esta disciplina de planificación a otro generador, el flujo de trabajo de prompts de imagen a vídeo cubre la misma estructura acción-cámara-final.
Este es un ejemplo de imagen-a-video de Seedance, no una salida de Midjourney. Observe cómo una composición inicial clara otorga al movimiento un rumbo coherente.
Elija Baja Movilidad o Alta Movilidad según el costo del fallo
La Baja Movilidad protege la fuente
La Baja Movilidad es la opción predeterminada y tiene más probabilidades de producir movimientos sutiles del sujeto, una cámara más estable y cambios ambientales más lentos. Es la opción sensata para una primera prueba con rostros, moda, productos, edificios, alimentos y cualquier imagen en la que la identidad o la geometría importen más que el espectáculo. También puede resultar insuficiente y parecer casi estática, por lo que debe especificarse una acción visible pero moderada.

Para Baja Movilidad, inspeccione la forma del rostro, los radios del paraguas, la geometría del tranvía y si la pequeña acción solicitada es visible sin reencuadrar la toma.
La Alta Movilidad acepta mayor variación
La Alta Movilidad tiene más probabilidades de mover tanto a la cámara como al sujeto. Se adapta bien a persecuciones, baile, pasos de vehículos, revelaciones y tomas donde la energía importa más que la preservación estricta de los fotogramas. El compromiso es una mayor probabilidad de anatomía distorsionada, superficies deslizantes, fondos inestables o movimientos de cámara que eclipsen la acción pretendida. Pruébela como alternativa, no como una actualización automática.

En una revisión de Alta Movilidad, debe congelarse varios puntos del clip y compararse la estructura de los objetos, no juzgarse únicamente el momento más dramático.
Utilice una regla de decisión sencilla: elija el nivel de movilidad más bajo que complete visiblemente la toma. Si la Baja Movilidad preserva todo pero carece de energía, revise el verbo o la instrucción de cámara antes de cambiar de modo. Si la Alta Movilidad genera la acción pero rompe al sujeto, simplifique la composición original o divida la acción en una nueva toma. Un flujo de trabajo multi-fotograma clave suele ser mejor cuando las poses intermedias exactas son importantes.
Extienda únicamente el clip que ya funciona
Midjourney comienza con un video de cinco segundos. Una extensión añade cuatro segundos, y se pueden realizar hasta cuatro extensiones para alcanzar 21 segundos. «Extender Automático» continúa con el prompt original; «Extender Manual» le permite modificar la instrucción para el siguiente segmento. El hábito productivo útil consiste en aprobar el punto final actual antes de añadir tiempo.
Revise el último segundo a velocidad normal y fotograma a fotograma. ¿Sigue siendo el mismo rostro? ¿Son estables las manos y los objetos? ¿Ha llegado la cámara a una posición desde la cual pueda continuar? ¿Tiene el sujeto una acción siguiente plausible? Si el punto final es débil, una extensión generalmente propagará esa debilidad en lugar de repararla. Vuelva a ejecutarla o recórtela primero.
Escriba una extensión como el siguiente «beat», no como una reescritura completa. Por ejemplo: «el tranvía se detiene, ella cierra el paraguas y la cámara realiza un suave encuadre más amplio». Esto mantiene la dirección de la escena mientras otorga al segmento un cierre. El detallado flujo de trabajo de extensión de video muestra cómo preservar la transición entre la fuente, la continuación y la entrega final.

Un cierre limpio constituye un mejor punto final para una extensión que un fotograma capturado a mitad de giro o de un movimiento brusco de cámara.
Para una pieza con múltiples tomas, guarde como un paquete único el fotograma inicial aprobado, el clip elegido, el prompt, la configuración de movilidad, el tamaño del lote y el historial de extensiones. En el flujo de trabajo de referencia-a-video de Seedance Agent, esos recursos pueden permanecer vinculados al plan de tomas mientras compara resultados, aprueba la toma correcta y vuelve a ejecutar únicamente el segmento que falló.
Solución de problemas para los fallos más comunes con imágenes cargadas
El clip apenas se mueve
Reemplace una atmósfera vaga por un verbo observable y una pista ambiental. «Ambiente cinematográfico lluvioso» no especifica movimiento; «ella gira hacia el tranvía mientras las gotas de lluvia resbalan del paraguas» sí lo hace. Mantenga la Baja Movilidad para la primera revisión y pruebe la Alta Movilidad solo si, tras una instrucción más clara, sigue obteniéndose un rendimiento insuficiente.
El rostro, las manos o el producto cambian
Reduzca las acciones simultáneas, evite órbitas extremas de la cámara y asigne más píxeles a los detalles pequeños en el fotograma fuente. Si un punto de inspección cercana es muy pequeño en la imagen cargada, el modelo de animación dispone de poca estructura para preservar. Reencuadre la imagen o realice una toma cercana independiente, en lugar de exigir que una toma amplia se convierta en una toma detallada durante la animación.
La cámara ignora el prompt
Indique un único comportamiento de cámara: toma fija, acercamiento lento, panorámica suave o movimiento de seguimiento. No combine «estática», «con cámara en mano», «órbita» y «zoom» en una sola instrucción. Con --raw, el prompt puede tener mayor influencia, pero la composición fuente sigue limitando los movimientos plausibles.
La extensión presenta un salto en la unión
Vuelva al último clip limpio y elija un punto final con baja movilidad y geometría estable. Continúe con la acción existente en lugar de invertir inmediatamente la dirección. Si la unión sigue siendo evidente, trate la extensión como una nueva toma y oculte la transición mediante un corte intencional, en vez de extender repetidamente una transición defectuosa.
ConclusiónPara animar una imagen cargada en Midjourney, prepare un fotograma con claridad de profundidad y espacio suficiente para el movimiento, colóquelo en la ranura Animate, describa una acción visible y un comportamiento de cámara, y pruébelo con --bs 1. Comience con Low Motion cuando la continuidad sea fundamental, use High Motion cuando la escena pueda tolerar variaciones y extienda únicamente un punto final que ya sea estable. Para trabajos de producción, mantenga juntos la fuente, el prompt, la toma seleccionada y el historial de extensiones; luego construya la secuencia con Seedance Agent para que las aprobaciones y las repeticiones selectivas permanezcan vinculadas a la toma correcta.
¿Listo para probarlo tú mismo?
Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.
Créditos gratis al registrarte. Planes desde $20/mes.
Artículos relacionados
Más publicaciones en el mismo idioma que quizá quieras leer después.

Tutorial de Luma Dream Machine Extend: Crea una toma más larga sin romper la continuidad
Aprende a extender los vídeos de Luma Dream Machine mediante indicaciones en blanco, indicaciones dirigidas, fotogramas clave finales, transiciones limpias, comprobaciones de continuidad y ejecuciones selectivas nuevamente.
Leer artículo
Tutorial en vídeo del Asistente de IA de Synthesia: desde el material fuente hasta un borrador editable
Aprenda a utilizar Synthesia Assistant con indicaciones (prompts), archivos, guiones, esquemas (outlines), revisiones del storyboard, ediciones precisas de escenas y una revisión final de control de calidad (QA) fiable.
Leer artículo
Seedance frente a Vidu (2026): ¿Qué flujo de trabajo de video con IA se adapta mejor a tu proyecto?
Compara Seedance y Vidu en cuanto a calidad de video, referencias, audio nativo, edición, precios fuera de horario pico y producción multi-toma en 2026.
Leer artículo