- Blog
- Tutorial de referencia de voz Gemini Omni para vídeos de avatar coherentes
Tutorial de referencia de voz Gemini Omni para vídeos de avatar coherentes

Resumen de IA
¿Puede Gemini Omni utilizar mi voz como referencia?
Sí, mediante un avatar personal creado a partir de una grabación guiada de rostro y voz. Google no documenta la clonación arbitraria de voces a partir de archivos de audio como ruta estándar.
¿Qué cuenta necesito para un avatar personal?
Debe tener 18 años o más, iniciar sesión con una Cuenta personal de Google y ser elegible para esta función. La creación de videos con avatar requiere un plan de Google AI.
¿Cómo invoco el mismo avatar en un nuevo prompt?
Agregue el avatar desde el menú de carga o escriba @ y seleccione su nombre de usuario de Google. Mantenga explícitos el guion hablado, las acciones, la cámara y el entorno.
¿Cómo mejoro la coherencia vocal entre clips?
Reutilice el mismo avatar, mantenga estables las instrucciones sobre idioma y estilo de entrega, y compare los clips exportados en puntos de control idénticos antes de aprobar una secuencia.
Qué significa «referencia de voz» en Gemini Omni
Utilice la ruta documentada de avatar personal
Las personas que buscan un tutorial de referencia de voz Gemini Omni suelen desear un resultado práctico concreto: un presentador generado que se vea y suene reconociblemente como la misma persona en más de un clip. En las Aplicaciones Gemini, la ruta documentada es un avatar personal. Usted completa un proceso guiado de inscripción que graba su rostro y voz, y luego invoca ese avatar reutilizable al crear un video Gemini Omni. Esto difiere de subir una muestra de voz cualquiera y pedirle al modelo que la clone.
Esa distinción es importante. La página de ayuda actual de Google indica que las Aplicaciones Gemini pueden crear nuevos contenidos de IA con su propia voz y semejanza mediante su avatar. No describe una herramienta abierta de clonación de voces para otras personas. Construya el flujo de trabajo alrededor de la inscripción del titular de la cuenta, y utilice únicamente rostros, voces, guiones y activos de marca para los que tenga autorización.

Esta imagen editorial ilustra un entorno de grabación controlado; no es una captura de pantalla de Gemini ni una salida reclamada del modelo.
Separe la identidad vocal de la dirección interpretativa
El avatar proporciona el ancla de identidad reutilizable. Su prompt sigue dirigiendo la interpretación: palabras, ritmo, tono emocional, gestos, encuadre y entorno. Una referencia de voz no puede corregir un guion vago, una inscripción ruidosa o un prompt que solicite varios estados de ánimo incompatibles en ocho segundos. Trate la identidad y la interpretación como controles independientes.
Utilice el mismo breve guion de prueba para las dos o tres primeras ejecuciones. Si la voz cambia mientras las palabras permanecen fijas, tiene un problema de coherencia. Si el tiempo cambia porque reescribió el guion, eso es una variable de redacción. Esta separación hace que las revisiones sean útiles en lugar de aleatorias.
Para una decisión más amplia entre modelos, compare este flujo de trabajo con Gemini Omni frente a Seedance 2.5. La página de comparación asume la intención de selección de modelo; esta guía se centra exclusivamente en la tarea de voz del avatar.
Verifique el acceso antes de grabar
Confirme la cuenta, la edad, el plan y la región
Actualmente, Google enumera varias restricciones para los avatares. El titular de la cuenta debe tener al menos 18 años e iniciar sesión con una Cuenta personal de Google. La disponibilidad de avatares está limitada por región, y Google indica que los avatares no están disponibles actualmente en el EEE, Suiza ni el Reino Unido. La experiencia de avatar actualmente se admite solo en inglés. Crear un video con un avatar personal requiere un plan de Google AI.
Abra las Aplicaciones Gemini y busque Agregar archivos, Más cargas y luego Avatar. Si Avatar no aparece, no dedique tiempo a reescribir prompts. Primero confirme la cuenta iniciada, el plan, el idioma y la ubicación. La disponibilidad del producto puede cambiar, por lo que la interfaz a la que realmente pueda acceder es más autoritativa que una captura de pantalla antigua de un tutorial.
El flujo de trabajo general de video Gemini Omni también admite cuentas laborales o escolares elegibles con acceso calificado a Workspace, pero las instrucciones específicas para avatares personales describen explícitamente la inscripción con una Cuenta personal de Google. No asuma que un puesto en Workspace expone automáticamente los mismos controles de avatar.
Prepare un entorno limpio para la inscripción
La calidad de la inscripción comienza antes de que el modelo vea un prompt. Coloque el teléfono a la altura de los ojos. Use una iluminación uniforme que mantenga visibles los ojos, la nariz y la boca sin reflejos. Retire mascarillas, sombreros y gafas oscuras. Elija una habitación silenciosa sin otras voces, ventiladores, tráfico ni música. Mantenga a otras personas y rostros visibles fuera del fondo.

Una simple pasada de calibración reduce variables: teléfono a la altura de los ojos, luz natural uniforme, habitación silenciosa y un titular de cuenta claramente visible.
Lea las frases de inscripción proporcionadas de forma natural. No imite a un locutor comercial a menos que ese sea su estilo habitual de hablar. La referencia debe capturar una línea base reproducible, no una actuación única que no pueda replicar. Si la interfaz marca la grabación como problemática, use Volver a grabar en lugar de forzar una inscripción débil a producción.
Grabe e invoque el avatar personal
Complete la captura guiada de rostro y voz
En una computadora, abra las Aplicaciones Gemini, seleccione Agregar archivos, Más cargas y Avatar, luego escanee el código QR con un teléfono o tableta. Siga las instrucciones móviles para grabar el rostro y la voz, regrese a la computadora y seleccione Usar avatar. Se requiere acceso a la cámara y al micrófono durante esta captura.Google afirma que el avatar está vinculado al titular de la cuenta y que los datos del selfie y de la voz grabados durante el proceso de inscripción se eliminan de sus sistemas una vez creado el avatar. Revise los términos actuales en pantalla y la información de privacidad antes de realizar la grabación. Si el avatar está destinado a un tutorial corporativo, obtenga la aprobación del presentador tanto para los guiones específicos como para los canales de distribución, así como para la captura inicial.
Para un flujo de trabajo relacionado pero distinto dentro del producto de presentaciones de Google, consulte el tutorial de avatar personal de Google Vids. Mantenga esa vía separada al documentar el proceso de su equipo, para que los editores sepan si están trabajando en Gemini Apps o en Google Vids.
Invocar deliberadamente la misma identidad
Inicie un nuevo video de Gemini Omni, agregue el avatar desde el menú de carga o escriba @ y seleccione su nombre de usuario de Google. El token del nombre de usuario es la referencia de identidad. Coloque la línea hablada entre comillas y luego describa la entonación, la acción visible, el encuadre, el comportamiento de la cámara y el entorno.
Un patrón compacto de indicación es:
@[nombre de usuario de Google]dice: «Hoy les mostraré cómo centrar un cuenco de arcilla». Ritmo calmado e instructivo, una breve pausa tras «hoy», gesto natural con la mano hacia el torno, plano medio, cámara fija, estudio de cerámica tranquilo con luz diurna suave, dicción clara, sin conversación de fondo ni subtítulos.
No sobrecargue la prueba con cambios de vestuario, cámara en movimiento, habitación abarrotada ni un discurso extenso. Primero demuestre que la voz y el rostro siguen siendo utilizables en un plano estable. Añada una única variable de producción por iteración aprobada.
Generar un breve video guiado por voz
Escribir pensando en la duración y el ritmo hablado
El texto hablado consume tiempo. Lea en voz alta la frase con un cronómetro antes de generarla. Para un clip corto generado, una oración clara resulta más segura que un párrafo comprimido en una pronunciación apresurada. Indique una pausa, un énfasis y una dirección emocional. Evite indicaciones escénicas que puedan confundirse con diálogo.
Mantenga el vocabulario coloquial. Los números, abreviaturas, nombres de marca y nombres propios poco comunes merecen una simplificación fonética o una reformulación de la oración. Si la pronunciación es crítica, pruebe ese término de forma aislada antes de construir la escena completa. Este también es el momento adecuado para decidir si los subtítulos se añadirán posteriormente, en lugar de integrarse directamente en la imagen.
La guía de coherencia vocal para Seedance 2.5 ofrece una lista complementaria de verificación para el ritmo, los turnos de habla y la revisión cruzada entre planos cuando el proyecto va más allá de un único clip con avatar.
Proporcionar instrucciones separadas para audio y visuales
Escriba el requisito de audio en una oración y el requisito visual en otra. «Voz clara, grabada con micrófono cercano y sin eco ambiental» describe el sonido. «Primer plano medio, cámara fija, luz suave proveniente de una ventana» describe la imagen. Separarlos facilita diagnosticar los fallos.
Este es un resultado editorial existente de Seedance, no una referencia de rendimiento de Gemini Omni. Úselo únicamente como ejemplo de revisión para la sincronización de la habla, el movimiento facial y el sonido de fondo.
Si la habla es correcta pero la escena es visualmente inadecuada, revise el lenguaje referido a la cámara o al entorno. Si la escena funciona pero la voz no es clara, acorte la frase y simplifique su entonación. La guía de video con audio nativo explica cómo revisar diálogo, ambiente y imagen como capas independientes.
Revisar la voz y el parecido antes de escalar
Aplicar los mismos tres puntos de control en cada exportación
Descargue el video generado y revíselo fuera de la interfaz de creación. Escúchelo una vez sin verlo, luego véalo una vez con el sonido silenciado y, finalmente, revíselo con ambos elementos combinados. En el primer segundo, el segundo intermedio y el último segundo, evalúe la identidad del hablante, la pronunciación, el ritmo, el movimiento labial, la estabilidad facial, los gestos, el sonido de fondo y la editabilidad.

La revisión debe producir evidencia tangible: notas de la transcripción, códigos de tiempo y una decisión inequívoca de mantener, revisar o rechazar.
Utilice tres resultados posibles. Mantener, cuando la persona sigue siendo reconocible, la frase es inteligible y el clip finaliza limpiamente. Revisar, cuando un único problema controlable —ritmo, pronunciación, gesto o encuadre— puede modificarse sin reconstruir el concepto. Rechazar, cuando se produce una desviación de la identidad, la habla se vuelve inutilizable o el resultado genera riesgos de consentimiento o de marca.
Conservar un registro de aprobación
Guarde exactamente el indicador utilizado, el guion, la ruta de la cuenta, la versión del avatar, la fecha de generación, el archivo exportado y las notas de revisión. No confíe en el historial de chat como su archivo de producción. Si posteriormente cambia alguna pronunciación, el registro mostrará si la causa fue un nuevo guion, una nueva inscripción del avatar o una actualización del modelo.

Un concepto editorial finalizado debe conservar al presentador, el estudio y el tono instructivo establecidos en los fotogramas de referencia.
Para trabajos con múltiples planos, use Seedance Agent para transformar el briefing en un plan de tomas, mantener los roles y guiones de referencia vinculados a sus respectivas escenas, revisar las salidas reales y volver a generar únicamente el segmento débil. Esto no sustituye el consentimiento ni la aprobación vocal; reduce, en cambio, la carga de coordinación tras tomarse dichas decisiones.
ConclusiónUn flujo de trabajo fiable de referencia de voz Gemini Omni comienza con el registro documentado del avatar personal, no con la suposición de que cualquier archivo de audio pueda clonar cualquier voz. Verifique la elegibilidad, grabe a un titular de cuenta en un entorno silencioso y controlado, invoque el mismo avatar @username y mantenga el primer guion breve; además, revise por separado la voz, el parecido y el movimiento. Cuando un presentador aprobado deba grabar una secuencia más larga, traslade las pruebas, los guiones y las referencias al flujo de producción de video de Seedance para que cada toma pueda planificarse y corregirse sin perder la decisión original sobre la voz.
¿Listo para probarlo tú mismo?
Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.
Créditos gratis al registrarte. Planes desde $20/mes.
Artículos relacionados
Más publicaciones en el mismo idioma que quizá quieras leer después.

Generador de vídeos con IA Upsampler gratuito: Guía práctica para tu primer vídeo
Aprende a probar el generador de vídeos con IA gratuito de Upsampler sin necesidad de registrarte, selecciona una entrada de texto o imagen, escribe un prompt centrado y revisa la exportación.
Leer artículo
Gemini Omni frente a Seedance 2.5: ¿Cuál funciona mejor para tus vídeos?
Compara Gemini Omni frente a Seedance 2.5 en cuanto a generación, edición de vídeo, extensiones, referencias, audio, resolución, precios y flujos de trabajo reales de producción.
Leer artículo
Precios de Seedance 2026: Planes, créditos y el flujo de trabajo de Seedance 2.5 más económico
Compara los planes actuales de Seedance, los créditos y los costos reales de Seedance 2.5 para clips cortos, vídeos largos y reproducciones repetidas antes de elegir entre Mini, Standard o Plus.
Leer artículo