- 블로그
- 일관된 아바타 동영상 제작을 위한 Gemini Omni 음성 참조 튜토리얼
AI 개요
Gemini Omni가 내 음성을 참조로 사용할 수 있나요?
예, 안내된 얼굴 및 음성 녹음으로 생성한 개인 아바타를 통해 가능합니다. Google은 임의의 오디오 파일을 이용한 음성 클로닝을 표준 절차로 문서화하지 않습니다.
개인 아바타를 사용하려면 어떤 계정이 필요한가요?
만 18세 이상이어야 하며, 개인 Google 계정으로 로그인하고 해당 기능을 사용할 자격이 있어야 합니다. 아바타 동영상 생성에는 Google AI 요금제가 필요합니다.
새 프롬프트에서 동일한 아바타를 어떻게 호출하나요?
업로드 메뉴에서 아바타를 추가하거나 @를 입력한 후 Google 사용자 이름을 선택하세요. 말하는 대본, 동작, 카메라 각도 및 환경 설정은 명시적으로 유지해야 합니다.
클립 간 음성 일관성을 향상시키려면 어떻게 해야 하나요?
동일한 아바타를 재사용하고, 언어 및 전달 지침을 일관되게 유지하며, 승인 전에 동일한 체크포인트에서 내보낸 클립을 비교하세요.
Gemini Omni에서 “음성 참조”란 무엇을 의미하나요?
문서화된 개인 아바타 절차를 사용하세요
Gemini Omni 음성 참조 튜토리얼을 검색하는 사용자는 일반적으로 하나의 실용적인 결과를 원합니다: 두 개 이상의 클립에서 외모와 음성이 동일한 인물처럼 인식되는 생성된 발표자입니다. Gemini 앱에서는 문서화된 절차가 바로 개인 아바타입니다. 안내된 등록 과정을 통해 귀하의 얼굴과 음성을 녹음한 후, Gemini Omni 동영상을 만들 때 이 재사용 가능한 아바타를 호출합니다. 이는 단순히 어떤 화자의 샘플 오디오 파일을 업로드하고 모델에게 클로닝을 요청하는 것과 다릅니다.
이 구분은 중요합니다. Google의 현재 도움말 페이지는 Gemini 앱이 귀하의 아바타를 사용하여 귀하의 음성과 외모로 새로운 AI 콘텐츠를 생성할 수 있다고 설명합니다. 그러나 타인을 위한 무제한 음성 클로닝 도구는 설명하지 않습니다. 워크플로우는 계정 소유자의 직접 등록을 기반으로 구축해야 하며, 사용하는 얼굴, 음성, 대본 및 브랜드 자산은 모두 귀하가 정식으로 사용 권한을 부여받은 것만 사용해야 합니다.

이 편집용 이미지는 통제된 녹음 환경을 보여주며, Gemini의 스크린샷이나 선언된 모델 출력이 아닙니다.
음성 정체성과 연기 지시를 분리하세요
아바타는 재사용 가능한 정체성 앵커를 제공합니다. 프롬프트는 여전히 연기를 지시합니다: 단어, 속도, 감정 톤, 제스처, 프레이밍 및 설정입니다. 음성 참조는 모호한 대본, 잡음이 많은 등록, 또는 8초 안에 여러 상충되는 분위기를 요구하는 프롬프트를 수정할 수 없습니다. 정체성과 연기를 별개의 제어 요소로 취급하세요.
처음 두 세 차례 실행 시 동일한 짧은 테스트 대본을 사용하세요. 단어는 고정된 상태에서 음성이 바뀐다면, 일관성 문제가 있는 것입니다. 대본을 다시 작성해 시간이 바뀌었다면, 이는 작문 변수입니다. 이러한 분리는 수정 작업을 무작위가 아닌 유용하게 만듭니다.
보다 광범위한 크로스모델 결정을 위해 Gemini Omni vs Seedance 2.5 비교를 참고하세요. 비교 페이지는 모델 선택 의도를 다루고 있으며, 본 가이드는 아바타 음성 작업에 집중합니다.
녹음 전 접근 권한 확인
계정, 연령, 요금제 및 지역을 확인하세요
Google은 현재 아바타에 대해 여러 가지 접근 조건을 제시하고 있습니다. 계정 소유자는 만 18세 이상이어야 하며, 개인 Google 계정으로 로그인해야 합니다. 아바타는 지역에 따라 사용 가능 여부가 제한되며, Google은 현재 EEA, 스위스, 영국에서는 아바타를 제공하지 않는다고 밝혔습니다. 아바타 경험은 현재 영어로만 지원됩니다. 개인 아바타를 사용한 동영상 생성에는 Google AI 요금제가 필요합니다.
Gemini 앱을 열고 파일 추가 → 더 많은 업로드 → 아바타를 찾아보세요. 아바타 항목이 보이지 않으면, 프롬프트를 다시 작성하는 데 시간을 낭비하지 마세요. 먼저 로그인된 계정, 요금제, 언어 및 위치를 확인하세요. 제품 가용성은 변경될 수 있으므로, 실제 접근 가능한 인터페이스가 오래된 튜토리얼 스크린샷보다 더 신뢰할 수 있는 정보입니다.
Google의 일반적인 Gemini Omni 동영상 워크플로우는 자격을 갖춘 업무 또는 학교 계정(적격 Workspace 액세스 포함)도 지원하지만, 개인 아바타 관련 지침은 명확히 개인 Google 계정을 통한 등록을 설명합니다. Workspace 계정이 자동으로 동일한 아바타 제어 기능을 제공한다고 가정하지 마세요.
깨끗한 등록 환경을 준비하세요
등록 품질은 모델이 프롬프트를 보기도 전에 시작됩니다. 휴대폰을 눈높이에 놓으세요. 눈, 코, 입이 반사광 없이 선명하게 보이도록 균일한 조명을 사용하세요. 마스크, 모자, 어두운 안경은 착용하지 마세요. 다른 사람의 목소리, 팬 소음, 교통 소음, 음악이 없는 조용한 방을 선택하세요. 배경에 다른 사람이나 보이는 얼굴은 포함하지 마세요.

간단한 교정 과정은 변수를 줄입니다: 눈높이 휴대폰, 균일한 창문 조명, 조용한 방, 그리고 한 명의 명확히 보이는 계정 소유자.
제공된 등록 문장을 자연스럽게 읽으세요. 그것이 평소 말하는 방식이 아니라면, 상업용 발표자처럼 흉내 내지 마세요. 참조는 재현 가능한 기준선을 포착해야 하며, 재현 불가능한 단발성 연기일 수 없습니다. 인터페이스가 녹음을 문제 있다고 표시하면, 약한 등록을 강제로 생산에 투입하기보다는 다시 녹음(Retake)을 사용하세요.
개인 아바타 녹음 및 호출
안내된 얼굴 및 음성 캡처 완료
컴퓨터에서 Gemini 앱을 열고, 파일 추가 → 더 많은 업로드 → 아바타를 선택한 후, 휴대폰 또는 태블릿으로 QR 코드를 스캔하세요. 모바일 지침에 따라 얼굴과 음성을 녹음하고, 컴퓨터로 돌아와서 아바타 사용(Use avatar)을 선택하세요. 이 캡처 과정에서는 카메라 및 마이크로폰 접근 권한이 필요합니다.구글은 아바타가 계정 소유자와 연결되어 있으며, 등록 시 사용된 녹음된 셀프 사진 및 음성 데이터는 아바타 생성 후 구글 시스템에서 삭제된다고 밝혔습니다. 녹화 전 현재 화면에 표시되는 약관 및 개인정보 보호 정보를 반드시 검토하십시오. 아바타가 기업 교육 자료용으로 사용될 경우, 발표자의 승인을 받아야 하며, 이는 특정 대본과 배포 채널뿐 아니라 초기 촬영에도 적용됩니다.
구글의 프레젠테이션 제품 내에서 관련되지만 다른 워크플로우에 대해서는 Google Vids 개인 아바타 튜토리얼을 참조하십시오. 팀 프로세스 문서화 시 이 경로는 별도로 관리하여 편집자가 Gemini Apps에서 작업 중인지, 아니면 Google Vids에서 작업 중인지 명확히 인지할 수 있도록 하십시오.
동일한 정체성을 의도적으로 호출하기
새로운 Gemini Omni 영상을 시작하고, 업로드 메뉴에서 아바타를 추가하거나 @를 입력한 후 구글 사용자명을 선택합니다. 사용자명 토큰이 바로 정체성 참조입니다. 말하는 대사를 따옴표 안에 넣고, 전달 방식, 시각적 동작, 화면 크기(shot size), 카메라 동작 및 환경을 설명합니다.
간결한 프롬프트 패턴은 다음과 같습니다:
@[Google username]delivers: “Today I’ll show you how to center a clay bowl.” Calm instructional pace, one short pause after “today,” natural hand gesture toward the wheel, medium shot, locked camera, quiet daylight ceramics studio, clear speech, no background conversation, no captions.
시험 영상에 의상 변경, 카메라 이동, 혼잡한 공간, 긴 대사 등 여러 요소를 한 번에 과도하게 포함하지 마십시오. 먼저 음성과 얼굴 표현이 안정적인 화면에서 계속 사용 가능한지 확인하세요. 승인된 반복 단계마다 하나의 제작 변수만 추가하십시오.
짧은 음성 중심 영상 프롬프트 작성
지속 시간과 말하기 리듬에 맞춰 작성하기
말하는 내용은 시간을 소비합니다. 렌더링 전에 타이머를 사용해 대사를 직접 소리 내어 읽어보십시오. 짧은 생성 클립의 경우, 문단을 서두르는 말투로 압축하기보다는 하나의 명확한 문장이 더 안전합니다. 한 번의 일시 정지, 한 번의 강조, 한 가지 감정 방향을 명시하십시오. 대사를 연출 지시로 오인할 수 있는 무대 지시는 피하십시오.
어휘는 대화체로 유지하십시오. 숫자, 약어, 브랜드명, 흔치 않은 고유명사는 음차를 간소화하거나 문장을 재작성해야 합니다. 발음이 중요한 경우, 전체 장면을 구성하기 전에 해당 용어를 개별적으로 테스트하십시오. 또한 이 시점에서 자막을 나중에 추가할 것인지, 아니면 영상 내에 직접 생성할 것인지를 결정해야 합니다.
Seedance 2.5 음성 일관성 가이드는 프로젝트가 단일 아바타 클립을 넘어서 확장될 때, 속도 조절, 화자 전환, 크로스샷 검토를 위한 보완 체크리스트를 제공합니다.
음향과 시각 요건을 별도로 지시하기
음향 요구사항은 한 문장으로, 시각 요구사항은 또 다른 문장으로 작성하십시오. “Clear, close-mic speech with no room echo”는 음향을 묘사합니다. “Medium close-up, locked camera, soft window light”는 영상(화면)을 묘사합니다. 이를 분리하면 문제 진단이 쉬워집니다.
이는 Gemini Omni 벤치마크가 아닌 기존 Seedance 편집 출력입니다. 음성 타이밍, 얼굴 움직임, 배경 음향 검토용 예시로만 사용하십시오.
대사가 정확하지만 장면이 시각적으로 부적절한 경우, 카메라나 환경에 대한 언어를 수정하십시오. 장면은 적절하나 음성이 불분명한 경우, 대사를 줄이고 전달 방식을 단순화하십시오. 네이티브 오디오 영상 가이드에서는 대화, 주변 음향, 영상(화면)을 각각 독립된 레이어로 검토하는 방법을 설명합니다.
확장 전 음성 및 외모 검토
모든 내보내기에서 동일한 세 가지 검사 포인트 사용
생성된 영상을 다운로드하고, 제작 인터페이스 외부에서 검토하십시오. 먼저 영상을 보지 않고 음성만 듣고, 다음에는 음성 없이 영상만 보고, 마지막으로 음성과 영상을 함께 검토하십시오. 시작, 중간, 마지막 초에서 화자 정체성, 발음, 말하기 리듬, 입 움직임, 얼굴 안정성, 제스처, 배경 음향, 편집 가능성 등을 평가하십시오.

검토 결과는 증거를 남겨야 합니다: 대본 메모, 타임코드, 그리고 명확한 ‘승인’, ‘수정’, 또는 ‘거부’ 결정.
세 가지 결과만 사용하십시오. 승인은 인물이 계속 식별 가능하고, 대사가 이해 가능하며, 클립이 깔끔하게 종료될 때 적용됩니다. 수정은 속도, 발음, 제스처, 프레이밍 중 하나의 제어 가능한 문제가 존재하며, 개념을 다시 구축하지 않고도 변경 가능한 경우에 적용됩니다. 거부는 정체성이 흐트러지거나, 음성이 사용 불가능해지거나, 결과물이 동의 또는 브랜드 위험을 유발할 때 적용됩니다.
승인 기록 보존
정확한 프롬프트, 대본, 계정 경로, 아바타 버전, 생성 날짜, 내보낸 파일, 검토 메모를 모두 저장하십시오. 챗 기록을 생산 아카이브로 신뢰하지 마십시오. 나중에 발음이 바뀌었을 경우, 기록을 통해 원인이 새 대본, 새 아바타 등록, 혹은 모델 업데이트 중 어느 것인지 확인할 수 있습니다.

완성된 편집 컨셉은 기준 프레임에서 설정된 발표자, 스튜디오, 교육적 어조를 유지해야 합니다.
멀티샷 작업의 경우, Seedance Agent를 사용하여 기획서를 샷 플랜으로 변환하고, 참조 역할과 대본을 각 장면에 연결하며, 실제 출력물을 검토하고 약한 구간만 다시 실행하십시오. 이는 동의 또는 음성 승인을 대체하지 않으며, 이러한 결정이 이루어진 후의 조정 작업량을 줄여줍니다.
결론신뢰할 수 있는 Gemini Omni 음성 참조 워크플로우는 문서화된 개인 아바타 등록에서 시작되며, 임의의 오디오 파일로 임의의 음성을 복제할 수 있다고 가정하는 것이 아닙니다. 자격 요건을 확인하고, 조용하고 통제된 환경에서 한 명의 계정 소유자만 녹음하세요. 동일한 @username 아바타를 호출하고, 첫 번째 대본은 짧게 유지한 후 음성, 외모, 동작을 각각 개별적으로 검토하세요. 승인된 발표자가 더 긴 시퀀스를 담당해야 할 경우, 증거 자료, 대본 및 참조 자료를 Seedance의 영상 제작 워크플로우로 이동시켜 각 씬을 계획하고 수정할 수 있도록 하되, 원래의 음성 결정을 잃지 않도록 주의하세요.
직접 해볼 준비가 되셨나요?
이 가이드의 단계를 Seedance에서 바로 적용해 프롬프트나 이미지를 몇 분 안에 완성도 높은 영상으로 바꿔보세요.
가입 시 무료 크레딧 제공. 요금제는 월 $20부터.
관련 글
같은 언어로 된 다음 추천 글입니다.

최고의 AI 애니메이션 영상 생성기: AI로 애니메이션 스타일 영상 만들기(2026)
2026년 최고의 AI 애니메이션 영상 생성기. Seedance 2.0, Runway, Pika, Kling을 사용해 텍스트 프롬프트로 애니메이션 스타일 영상 생성. 프롬프트 가이드 포함.
글 읽기
Upsampler AI 비디오 제너레이터 무료 버전: 실용적인 첫 클립 가이드
회원 가입 없이 Upsampler의 무료 AI 비디오 제너레이터를 테스트하는 방법, 텍스트 또는 이미지 입력 방식 선택, 집중적인 프롬프트 작성, 그리고 내보내기 결과 확인을 배우세요.
글 읽기
Gemini Omni 대 Seedance 2.5: 어떤 모델이 귀하의 동영상에 더 적합한가요?
생성, 동영상 편집, 확장, 참조, 오디오, 해상도, 가격, 실제 프로덕션 워크플로우 측면에서 Gemini Omni와 Seedance 2.5를 비교해 보세요.
글 읽기