Tutorial de referencia de voz Gemini Omni para vídeos de avatar coherentes

E
Emma Chen·10 min de lectura·Sep 17, 2026
Compartir en X
Tutorial de referencia de voz Gemini Omni para vídeos de avatar coherentes

Resumen de IA

¿Puede Gemini Omni utilizar mi voz como referencia?

Sí, mediante un avatar personal creado a partir de una grabación guiada de rostro y voz. Google no documenta la clonación arbitraria de voces a partir de archivos de audio como ruta estándar.

¿Qué cuenta necesito para un avatar personal?

Debe tener 18 años o más, iniciar sesión con una Cuenta personal de Google y ser elegible para esta función. La creación de videos con avatar requiere un plan de Google AI.

¿Cómo invoco el mismo avatar en un nuevo prompt?

Agregue el avatar desde el menú de carga o escriba @ y seleccione su nombre de usuario de Google. Mantenga explícitos el guion hablado, las acciones, la cámara y el entorno.

¿Cómo mejoro la coherencia vocal entre clips?

Reutilice el mismo avatar, mantenga estables las instrucciones sobre idioma y estilo de entrega, y compare los clips exportados en puntos de control idénticos antes de aprobar una secuencia.

Qué significa «referencia de voz» en Gemini Omni

Utilice la ruta documentada de avatar personal

Las personas que buscan un tutorial de referencia de voz Gemini Omni suelen desear un resultado práctico concreto: un presentador generado que se vea y suene reconociblemente como la misma persona en más de un clip. En las Aplicaciones Gemini, la ruta documentada es un avatar personal. Usted completa un proceso guiado de inscripción que graba su rostro y voz, y luego invoca ese avatar reutilizable al crear un video Gemini Omni. Esto difiere de subir una muestra de voz cualquiera y pedirle al modelo que la clone.

Esa distinción es importante. La página de ayuda actual de Google indica que las Aplicaciones Gemini pueden crear nuevos contenidos de IA con su propia voz y semejanza mediante su avatar. No describe una herramienta abierta de clonación de voces para otras personas. Construya el flujo de trabajo alrededor de la inscripción del titular de la cuenta, y utilice únicamente rostros, voces, guiones y activos de marca para los que tenga autorización.

Un retrato cercano de estilo documental de un presentador preparándose para grabar una referencia de voz en un estudio silencioso de cerámica

Esta imagen editorial ilustra un entorno de grabación controlado; no es una captura de pantalla de Gemini ni una salida reclamada del modelo.

Separe la identidad vocal de la dirección interpretativa

El avatar proporciona el ancla de identidad reutilizable. Su prompt sigue dirigiendo la interpretación: palabras, ritmo, tono emocional, gestos, encuadre y entorno. Una referencia de voz no puede corregir un guion vago, una inscripción ruidosa o un prompt que solicite varios estados de ánimo incompatibles en ocho segundos. Trate la identidad y la interpretación como controles independientes.

Utilice el mismo breve guion de prueba para las dos o tres primeras ejecuciones. Si la voz cambia mientras las palabras permanecen fijas, tiene un problema de coherencia. Si el tiempo cambia porque reescribió el guion, eso es una variable de redacción. Esta separación hace que las revisiones sean útiles en lugar de aleatorias.

Para una decisión más amplia entre modelos, compare este flujo de trabajo con Gemini Omni frente a Seedance 2.5. La página de comparación asume la intención de selección de modelo; esta guía se centra exclusivamente en la tarea de voz del avatar.

Verifique el acceso antes de grabar

Confirme la cuenta, la edad, el plan y la región

Actualmente, Google enumera varias restricciones para los avatares. El titular de la cuenta debe tener al menos 18 años e iniciar sesión con una Cuenta personal de Google. La disponibilidad de avatares está limitada por región, y Google indica que los avatares no están disponibles actualmente en el EEE, Suiza ni el Reino Unido. La experiencia de avatar actualmente se admite solo en inglés. Crear un video con un avatar personal requiere un plan de Google AI.

Abra las Aplicaciones Gemini y busque Agregar archivos, Más cargas y luego Avatar. Si Avatar no aparece, no dedique tiempo a reescribir prompts. Primero confirme la cuenta iniciada, el plan, el idioma y la ubicación. La disponibilidad del producto puede cambiar, por lo que la interfaz a la que realmente pueda acceder es más autoritativa que una captura de pantalla antigua de un tutorial.

El flujo de trabajo general de video Gemini Omni también admite cuentas laborales o escolares elegibles con acceso calificado a Workspace, pero las instrucciones específicas para avatares personales describen explícitamente la inscripción con una Cuenta personal de Google. No asuma que un puesto en Workspace expone automáticamente los mismos controles de avatar.

Prepare un entorno limpio para la inscripción

La calidad de la inscripción comienza antes de que el modelo vea un prompt. Coloque el teléfono a la altura de los ojos. Use una iluminación uniforme que mantenga visibles los ojos, la nariz y la boca sin reflejos. Retire mascarillas, sombreros y gafas oscuras. Elija una habitación silenciosa sin otras voces, ventiladores, tráfico ni música. Mantenga a otras personas y rostros visibles fuera del fondo.

El mismo presentador calibra un teléfono, un micrófono y un encuadre a la altura de los ojos antes de la inscripción del avatar

Una simple pasada de calibración reduce variables: teléfono a la altura de los ojos, luz natural uniforme, habitación silenciosa y un titular de cuenta claramente visible.

Lea las frases de inscripción proporcionadas de forma natural. No imite a un locutor comercial a menos que ese sea su estilo habitual de hablar. La referencia debe capturar una línea base reproducible, no una actuación única que no pueda replicar. Si la interfaz marca la grabación como problemática, use Volver a grabar en lugar de forzar una inscripción débil a producción.

Grabe e invoque el avatar personal

Complete la captura guiada de rostro y voz

En una computadora, abra las Aplicaciones Gemini, seleccione Agregar archivos, Más cargas y Avatar, luego escanee el código QR con un teléfono o tableta. Siga las instrucciones móviles para grabar el rostro y la voz, regrese a la computadora y seleccione Usar avatar. Se requiere acceso a la cámara y al micrófono durante esta captura.Google afirma que el avatar está vinculado al titular de la cuenta y que los datos del selfie y de la voz grabados durante el proceso de inscripción se eliminan de sus sistemas una vez creado el avatar. Revise los términos actuales en pantalla y la información de privacidad antes de realizar la grabación. Si el avatar está destinado a un tutorial corporativo, obtenga la aprobación del presentador tanto para los guiones específicos como para los canales de distribución, así como para la captura inicial.

Para un flujo de trabajo relacionado pero distinto dentro del producto de presentaciones de Google, consulte el tutorial de avatar personal de Google Vids. Mantenga esa vía separada al documentar el proceso de su equipo, para que los editores sepan si están trabajando en Gemini Apps o en Google Vids.

Invocar deliberadamente la misma identidad

Inicie un nuevo video de Gemini Omni, agregue el avatar desde el menú de carga o escriba @ y seleccione su nombre de usuario de Google. El token del nombre de usuario es la referencia de identidad. Coloque la línea hablada entre comillas y luego describa la entonación, la acción visible, el encuadre, el comportamiento de la cámara y el entorno.

Un patrón compacto de indicación es:

@[nombre de usuario de Google] dice: «Hoy les mostraré cómo centrar un cuenco de arcilla». Ritmo calmado e instructivo, una breve pausa tras «hoy», gesto natural con la mano hacia el torno, plano medio, cámara fija, estudio de cerámica tranquilo con luz diurna suave, dicción clara, sin conversación de fondo ni subtítulos.

No sobrecargue la prueba con cambios de vestuario, cámara en movimiento, habitación abarrotada ni un discurso extenso. Primero demuestre que la voz y el rostro siguen siendo utilizables en un plano estable. Añada una única variable de producción por iteración aprobada.

Generar un breve video guiado por voz

Escribir pensando en la duración y el ritmo hablado

El texto hablado consume tiempo. Lea en voz alta la frase con un cronómetro antes de generarla. Para un clip corto generado, una oración clara resulta más segura que un párrafo comprimido en una pronunciación apresurada. Indique una pausa, un énfasis y una dirección emocional. Evite indicaciones escénicas que puedan confundirse con diálogo.

Mantenga el vocabulario coloquial. Los números, abreviaturas, nombres de marca y nombres propios poco comunes merecen una simplificación fonética o una reformulación de la oración. Si la pronunciación es crítica, pruebe ese término de forma aislada antes de construir la escena completa. Este también es el momento adecuado para decidir si los subtítulos se añadirán posteriormente, en lugar de integrarse directamente en la imagen.

La guía de coherencia vocal para Seedance 2.5 ofrece una lista complementaria de verificación para el ritmo, los turnos de habla y la revisión cruzada entre planos cuando el proyecto va más allá de un único clip con avatar.

Proporcionar instrucciones separadas para audio y visuales

Escriba el requisito de audio en una oración y el requisito visual en otra. «Voz clara, grabada con micrófono cercano y sin eco ambiental» describe el sonido. «Primer plano medio, cámara fija, luz suave proveniente de una ventana» describe la imagen. Separarlos facilita diagnosticar los fallos.

Muestra editorial de diálogo de Seedance para revisar sincronización de habla y movimiento facial

Este es un resultado editorial existente de Seedance, no una referencia de rendimiento de Gemini Omni. Úselo únicamente como ejemplo de revisión para la sincronización de la habla, el movimiento facial y el sonido de fondo.

Si la habla es correcta pero la escena es visualmente inadecuada, revise el lenguaje referido a la cámara o al entorno. Si la escena funciona pero la voz no es clara, acorte la frase y simplifique su entonación. La guía de video con audio nativo explica cómo revisar diálogo, ambiente y imagen como capas independientes.

Revisar la voz y el parecido antes de escalar

Aplicar los mismos tres puntos de control en cada exportación

Descargue el video generado y revíselo fuera de la interfaz de creación. Escúchelo una vez sin verlo, luego véalo una vez con el sonido silenciado y, finalmente, revíselo con ambos elementos combinados. En el primer segundo, el segundo intermedio y el último segundo, evalúe la identidad del hablante, la pronunciación, el ritmo, el movimiento labial, la estabilidad facial, los gestos, el sonido de fondo y la editabilidad.

El presentador y un editor comparan la forma de onda, el rostro y las anotaciones del guion durante una revisión estructurada

La revisión debe producir evidencia tangible: notas de la transcripción, códigos de tiempo y una decisión inequívoca de mantener, revisar o rechazar.

Utilice tres resultados posibles. Mantener, cuando la persona sigue siendo reconocible, la frase es inteligible y el clip finaliza limpiamente. Revisar, cuando un único problema controlable —ritmo, pronunciación, gesto o encuadre— puede modificarse sin reconstruir el concepto. Rechazar, cuando se produce una desviación de la identidad, la habla se vuelve inutilizable o el resultado genera riesgos de consentimiento o de marca.

Conservar un registro de aprobación

Guarde exactamente el indicador utilizado, el guion, la ruta de la cuenta, la versión del avatar, la fecha de generación, el archivo exportado y las notas de revisión. No confíe en el historial de chat como su archivo de producción. Si posteriormente cambia alguna pronunciación, el registro mostrará si la causa fue un nuevo guion, una nueva inscripción del avatar o una actualización del modelo.

El presentador aprobado explica un cuenco de arcilla en el torno en una toma didáctica finalizada

Un concepto editorial finalizado debe conservar al presentador, el estudio y el tono instructivo establecidos en los fotogramas de referencia.

Para trabajos con múltiples planos, use Seedance Agent para transformar el briefing en un plan de tomas, mantener los roles y guiones de referencia vinculados a sus respectivas escenas, revisar las salidas reales y volver a generar únicamente el segmento débil. Esto no sustituye el consentimiento ni la aprobación vocal; reduce, en cambio, la carga de coordinación tras tomarse dichas decisiones.

ConclusiónUn flujo de trabajo fiable de referencia de voz Gemini Omni comienza con el registro documentado del avatar personal, no con la suposición de que cualquier archivo de audio pueda clonar cualquier voz. Verifique la elegibilidad, grabe a un titular de cuenta en un entorno silencioso y controlado, invoque el mismo avatar @username y mantenga el primer guion breve; además, revise por separado la voz, el parecido y el movimiento. Cuando un presentador aprobado deba grabar una secuencia más larga, traslade las pruebas, los guiones y las referencias al flujo de producción de video de Seedance para que cada toma pueda planificarse y corregirse sin perder la decisión original sobre la voz.

¿Listo para probarlo tú mismo?

Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.

Créditos gratis al registrarte. Planes desde $20/mes.