一貫したアバター動画のための Gemini Omni ボイス参照チュートリアル

E
Emma Chen·読む時間: 約1分·Sep 17, 2026
Xで共有
一貫したアバター動画のための Gemini Omni ボイス参照チュートリアル

AI の概要

Gemini Omni は私の声をリファレンスとして使用できますか?

はい。ガイド付きの顔と声の録音から作成したパーソナル・アバターを通じて可能です。Google は、任意の音声ファイルを用いたボイス・クローン生成を標準的な手法として文書化していません。

パーソナル・アバターを利用するには、どのアカウントが必要ですか?

18 歳以上である必要があります。また、個人用 Google アカウントでサインインし、当該機能の利用資格を有している必要があります。アバター動画の作成には Google AI プランが必要です。

新しいプロンプトで同じアバターを呼び出すにはどうすればよいですか?

アップロードメニューからアバターを追加するか、@ を入力して自分の Google ユーザー名を選択してください。話す台本、アクション、カメラ設定、および環境については、明示的に指定し続けてください。

クリップ間で声の一致性を高めるにはどうすればよいですか?

同じアバターを再利用し、言語および発話指示を一定に保ち、承認前にシーケンス全体を同一のチェックポイントでエクスポートされたクリップ同士で比較してください。

Gemini Omni における「ボイス・リファレンス」とは何か

文書化されたパーソナル・アバターのルートを利用する

Gemini Omni ボイス・リファレンス入門チュートリアル を検索するユーザーは、通常、実用的な単一の成果を求めています:複数のクリップにおいて、見た目も声も明確に同一人物であるように生成されたプレゼンターです。Gemini Apps では、公式に文書化されているルートは「パーソナル・アバター」です。ユーザーは、ガイド付き登録プロセスを通じて自身の顔と声を録音し、その後、Gemini Omni 動画を作成する際にその再利用可能なアバターを呼び出します。これは、任意のスピーカー音声サンプルをアップロードし、モデルにそれをクローンさせるという手法とは異なります。

この区別は重要です。Google の現在のヘルプページには、「Gemini Apps は、あなたのアバターを用いることで、あなた自身の声と外見による新しい AI コンテンツを作成できます」と記載されています。しかし、他者の声を対象とした無制限のボイス・クローン生成ツールについては一切説明されていません。ワークフローは、アカウント所有者自身の登録に基づいて構築し、顔、声、台本、ブランド資産については、使用が許可されたもののみを用いてください。

静かな陶芸スタジオで、プレゼンターがボイス・リファレンス録音の準備をしているドキュメンタリー風のクローズアップ・ポートレート

この編集用画像は、制御された録音環境を示すものであり、Gemini のスクリーンショットでも、モデル出力と主張された画像でもありません。

声のアイデンティティとパフォーマンス指示を分離する

アバターは再利用可能なアイデンティティのアンカーを提供します。一方、プロンプトは依然としてパフォーマンス(言葉、ペース、感情トーン、ジェスチャー、フレーミング、設定)を指示します。ボイス・リファレンスは、あいまいな台本、ノイズの多い登録、あるいは 8 秒間に複数の互換性のないトーンを要求するようなプロンプトを修復することはできません。アイデンティティとパフォーマンスは、それぞれ独立した制御要素として扱ってください。

最初の 2~3 回の試行では、同じ短いテスト台本を用いてください。言葉が固定されたまま声が変化する場合、それは一貫性の問題です。一方、台本を書き直したためにタイミングが変化した場合は、それは台本の変更による変数です。この分離により、修正作業が無作為ではなく、有意義なものになります。

より広範なマルチモデル比較をご希望の場合、Gemini Omni vs Seedance 2.5 をご参照ください。この比較ページはモデル選択の意図を明確に定義していますが、本ガイドはアバター・ボイスのタスクに焦点を当てた内容に留まります。

録音開始前にアクセス権限を確認する

アカウント、年齢、プラン、地域を確認する

Google は現在、アバター機能について複数の利用制限を設けています。アカウント所有者は 18 歳以上である必要があり、個人用 Google アカウントでサインインしている必要があります。アバターの利用可能地域は限定されており、Google によると、現時点では欧州経済領域(EEA)、スイス、および英国ではアバターは利用できません。アバター体験は現時点で英語のみに対応しています。個人用アバターを用いた動画作成には Google AI プランが必要です。

Gemini Apps を開き、「ファイルを追加」→「その他のアップロード」→「アバター」を探してください。もし「アバター」が表示されない場合は、プロンプトの書き直しに時間を費やすのはやめてください。まず、サインイン中のアカウント、プラン、言語、および所在地を確認してください。製品の提供状況は変更される可能性があるため、実際にアクセス可能なインターフェースこそが、古いチュートリアルのスクリーンショットよりも信頼性の高い情報源です。

Google の一般的な Gemini Omni 動画ワークフローでは、適格な Workspace アクセスを持つ業務または教育用アカウントも対象となりますが、パーソナル・アバターに関する手順は、明確に個人用 Google アカウントでの登録を前提としています。Workspace のライセンスを保有しているからといって、自動的に同じアバター制御が利用可能になるとは限りません。

クリーンな登録環境を整える

登録品質は、モデルがプロンプトを見る前から始まっています。スマートフォンを目の高さに配置してください。目・鼻・口が光沢なく明瞭に見えるよう、均一な照明を使用してください。マスク、帽子、サングラスは外してください。他の人の声、ファンの音、交通音、音楽のない静かな部屋を選んでください。背景に他の人物や可視化可能な顔が写り込まないように注意してください。

同じプレゼンターが、アバター登録の前にスマートフォン、マイク、および目の高さのフレーミングをキャリブレーションしている様子

シンプルなキャリブレーションにより、変数が削減されます:目の高さのスマートフォン、均一な窓からの自然光、静かな部屋、そして明瞭に見えるアカウント所有者一人だけ。

提示された登録用の台詞は、自然な話し方で読み上げてください。それが普段の話し方でない限り、コマーシャルのアナウンサーを真似る必要はありません。リファレンスは、再現可能な基準値を捉えるものであり、一度限りの、再現不可能なパフォーマンスではありません。インターフェースが録音を不適切と判断した場合、弱い登録を強引に本番運用に持ち込むのではなく、「再録音」を用いてください。

パーソナル・アバターの録音と呼び出し

ガイド付きの顔・声のキャプチャを完了する

コンピューターで Gemini Apps を開き、「ファイルを追加」→「その他のアップロード」→「アバター」を選択し、スマートフォンまたはタブレットで QR コードをスキャンしてください。モバイル端末の指示に従って顔と声を録音し、コンピューターに戻って「アバターを使用」を選択してください。このキャプチャ中は、カメラおよびマイクへのアクセスが必須です。Google によると、アバターはアカウント所有者と関連付けられており、登録時に記録されたセルフィーおよび音声データは、アバターが作成された後に Google のシステムから削除されます。録音を開始する前に、現在画面上に表示されている利用規約およびプライバシーに関する情報を必ず確認してください。アバターが企業向けチュートリアルで使用される場合、プレゼンターによる特定の台本および配信チャネルへの承認に加え、初期撮影についても承認を得てください。

Google のプレゼンテーション製品内において、関連性はあるものの異なるワークフローについては、Google Vids 個人アバターチュートリアルをご参照ください。チームのプロセスを文書化する際には、このルートを明確に区別して記述し、編集者が Gemini Apps で作業しているのか、それとも Google Vids で作業しているのかを一目でわかるようにしてください。

同じアイデンティティを意図的に呼び出す

新しい Gemini Omni 動画を開始し、アップロードメニューからアバターを追加するか、@ を入力して Google ユーザー名を選択します。このユーザー名トークンが、アイデンティティを参照する識別子となります。発話する台詞は引用符(")で囲み、その後に話し方(トーン・リズム)、可視的な動作、ショットサイズ、カメラの挙動、および環境を記述します。

簡潔なプロンプト形式の例は以下の通りです:

@[Google ユーザー名] が次のように語ります:「今日は、粘土のボウルをセンターに合わせる方法をお見せします。」落ち着いた指導的ペースで、”today” の直後に短い一呼吸の間を置き、自然な手の動きでろくろを指し示す。中距離ショット、固定カメラ、静かな昼光の陶芸スタジオ、はっきりとした発音、背景での会話なし、字幕なし。

テストに衣装の変更、移動カメラ、混雑した部屋、長文の台詞など、過剰な要素を盛り込まないでください。まず、安定したショット内で音声と顔の表現が継続して有効であることを検証しましょう。その後、承認済みの反復ごとに、1 つの制作変数のみを追加してください。

短い音声主導型動画をプロンプトで生成する

再生時間と話し言葉のリズムに合わせて作成する

話し言葉は再生時間に直接影響します。レンダリングを実行する前に、ストップウォッチを使いながら台詞を実際に声に出して読み上げてください。短い生成動画では、1 つの明瞭な文を用いる方が、急いで話す必要のある段落を圧縮するよりも安全です。1 か所の休止、1 か所の強調、そして 1 つの感情的方向性を明示してください。台詞と誤解されかねない舞台指示は避けてください。

語彙は日常会話に近いものに保ってください。数字、略語、ブランド名、および珍しい固有名詞は、発音しやすいよう音訳するか、文全体を書き直す必要があります。発音が特に重要な場合は、完全なシーンを作成する前に、その単語単体でテストを行ってください。また、この段階で、字幕を後から追加するか、画像内に生成するかを決定することも重要です。

プロジェクトが単一のアバターカットを超えて拡大する場合、Seedance 2.5 の音声一貫性ガイドでは、ペーシング、話者交代、クロスショットレビューのための補完的なチェックリストが提供されています。

音声と映像に対してそれぞれ独立した指示を与える

音声に関する要件は 1 文で、映像に関する要件は別の 1 文で記述してください。「部屋の反響なし、マイクに近づいたクリアな音声」は音に関する記述です。「中距離クローズアップ、固定カメラ、柔らかい窓からの自然光」は映像に関する記述です。これらを分離することで、問題の原因をより容易に特定できます。

音声タイミングおよび顔の動きのレビュー用 Seedance 編集用対話サンプル

これは既存の Seedance 編集出力であり、Gemini Omni のベンチマークではありません。音声タイミング、顔の動き、および背景音のレビュー例としてのみご利用ください。

音声が正しく再生されているが映像が不適切な場合は、カメラや環境に関する記述を修正してください。逆に、映像は適切だが音声が不明瞭な場合は、台詞を短くし、話し方を簡素化してください。ネイティブ音声動画ガイドでは、対話、アンビエンス、映像をそれぞれ独立したレイヤーとしてレビューする方法が説明されています。

大規模展開の前に音声と外見を確認する

すべてのエクスポートで同一の 3 つのチェックポイントを使用する

生成された動画をダウンロードし、作成インターフェースの外でレビューしてください。まず映像を見ずに音声だけを聴き、次に音声をミュートして映像だけを視聴し、最後に音声と映像を同時に確認します。動画の冒頭、中盤、終盤の各 1 秒間について、話者のアイデンティティ、発音、リズム、口の動き、顔の安定性、ジェスチャー、背景音、および編集可能性を評価してください。

プレゼンターと編集者が構造化されたレビュー中に波形、顔、台本メモを比較しています

レビューでは、文字起こしメモ、タイムコード、および「採用」「修正」「却下」のいずれか明確な判断結果という形で、根拠となる証拠を残す必要があります。

次の 3 つの判定結果を使用してください。採用:人物が認識可能であり、台詞が聞き取れ、クリップがきれいに終了している場合。修正:ペース、発音、ジェスチャー、フレーミングのいずれか 1 つという制御可能な問題があり、コンセプトを再構築せずに修正できる場合。却下:アイデンティティが変化し、音声が使い物にならなくなる、または同意・ブランド上のリスクを生む結果となった場合。

承認記録を保存する

使用した正確なプロンプト、台本、アカウント経路、アバターのバージョン、生成日、エクスポート済みファイル、およびレビューのメモをすべて保存してください。チャット履歴を制作アーカイブとして依存しないでください。後になって発音が変化した場合、記録により、その原因が新しい台本、新しいアバター登録、あるいはモデルの更新のいずれであったかを明らかにすることができます。

承認済みのプレゼンターが完成した指導ショットで、ろくろの前で粘土のボウルについて説明しています

完成した編集コンセプトでは、参照フレームで確立されたプレゼンター、スタジオ、および指導的トーンを維持する必要があります。

マルチショット作業では、Seedance Agent を使用して、 brief をショットプランに変換し、各シーンに参照役割および台本を紐付け、実際の出力をレビューし、弱いセグメントのみを再実行してください。ただし、これは同意や音声承認を代替するものではなく、これらの意思決定後の調整作業を軽減するものです。

結論信頼性の高い Gemini Omni 音声リファレンス ワークフローは、文書化されたパーソナルアバター登録から始まります。つまり、任意の音声ファイルで任意の音声をクローンできると想定してはいけません。まず資格要件を確認し、静かで制御された環境で1名のアカウント保有者を録音してください。その後、同じ @username アバターを呼び出し、最初の台本は短めにし、音声・似顔・動きをそれぞれ個別にレビューします。承認済みのプレゼンターがより長いシークエンスを担当する必要がある場合は、証拠資料・台本・リファレンスを Seedance の動画制作ワークフロー へ移行してください。これにより、各ショットを計画・修正できるようになりますが、元の音声選択は失われません。

自分でも試してみますか?

このガイドの手順をSeedanceでそのまま試し、プロンプトや画像を数分で完成度の高い動画に変えましょう。

登録で無料クレジット。プランは月額$20から。