- ブログ
- HeyGen の翻訳速度 vs 精度:どのモードを選択すべきか?
AI Overview
HeyGen の Speed 翻訳と Precision 翻訳の違いは何ですか?
両方とも音声を翻訳し、リップシンク(口の動き同期)を含みます。Speed は、比較的シンプルで、主に正面を向いた映像を対象としています。一方、Precision は、口の可視性が低い状況、カメラアングルの変化、話者交代といった難しい条件に対応するよう設計されています。モード名だけで判断せず、元映像の撮影条件に基づいて選択してください。
Speed モードは、必ず処理完了が速いですか?
必ずしもそうではありません。「Speed」という名称は、翻訳エンジンのオプションを示すものであり、処理時間の短縮を保証するものではありません。実際の処理時間は、元映像の長さ、アカウントの同時実行数、およびキューの混雑状況にも依存します。したがって、固定の時間短縮を前提にするのではなく、実際に完了したジョブの結果を比較してください。
どのような場合に Audio Only を代わりに使用すべきですか?
話者が画面外にいる、画角内で小さく写っている、またはBロール(補足映像)によって覆われている場合、また、口の動きと字幕の一致(リップシンク)が不要な場合は、Audio Only を使用してください。このモードでは、音声を翻訳・再録音しますが、視聴者が確認できないリップシンクのために追加コストを支払う必要はありません。
多言語動画を本格展開する前に、どのようにテストすればよいですか?
まず代表的な1言語のみを翻訳し、用語や音声付きの全クリップを確認してから、スクリプトを承認または修正してください。その後、他の言語の展開を開始します。短いパイロット版を実施することで、口の動き、タイミング、話者割り当てに関する問題を早期に発見できます。
HeyGen の3つの翻訳エンジンが実際に実行すること
HeyGen のビデオ翻訳ワークフローでは、現在 Audio Only、Speed、Precision の3種類のエンジン選択肢が提供されています。Audio Only はリップシンクなしで音声を翻訳・再録音します。Speed と Precision はどちらも、視認可能な口の動きとの同期を試みますが、それぞれが想定する映像の種類が異なります。HeyGen のヘルプセンターでは、Speed を「正面を向いた話者によるシンプルな映像」向け、Precision を「横顔、被写体の遮蔽、カメラアングルの急激な変化、複雑な会話」向けと位置付けています。これはあくまで選択のガイドラインであり、すべての困難な映像が自動的に成功することを保証するものではありません。
公開されているクレジット料金表では、Audio Only は元映像1分あたり4クレジット、Speed は6クレジット、Precision は10クレジットと記載されています。注文前にアカウントの料金体系を確認してください。プランやAPI課金は異なる場合があります。モードのラベルは納期を保証するものではありません。HeyGen の別途提供されるガイダンスでは、元映像1分あたり約5分の処理時間が目安とされており、同時実行数や需要状況によって待ち時間が変動します。
Speed は元映像の撮影条件に基づく判断です
最も適した Speed の候補は、カメラに向かって話す1人の話者が明瞭に映り、顔が遮られておらず、急激なカットが少ない映像です。このような映像で Speed のパイロットテストを行ってください。Precision よりもクレジット消費が少ないとはいえ、難解な単語、首の回転、字幕の品質については依然としてレビューが必要です。

参考画像(HeyGen の出力ではありません):このシンプルで遮蔽のない顔は、Speed でパイロットテストするのに適した元映像のタイプです。
Precision は「可視的な複雑さ」に対応するモードです
横顔、口の被覆、急激なアングル変化、あるいは2人の話者が交互に話すようなシーンには、Precision を選択してください。ここで問われるのは、「これらの可視リスクが、追加クレジットを支払う価値があるか?」という点です。もし翻訳の文言そのものが不正確であれば、エンジンを変更してもスクリプトの誤りは修正されません。

横顔/被覆のケースの参考画像:1枚の好ましい静止画ではなく、全セリフにわたって唇の輪郭の安定性を確認してください。
元映像からモードを選択する
判断の根拠として、映像そのものを活用してください。各話者セクションを「口が見えない」「シンプルに見える顔」「困難な可視顔」のいずれかに分類してください。たとえば、ナレーション付きの製品モンタージュが主体の場合は、Audio Only で十分かもしれません。1人のプレゼンターが全体を通してカメラに向かって話す場合は、まず Speed を試してください。一方、顔の角度、重なり、話者交代が成果物の核となる場合は、都合の良い簡単なクリップではなく、該当する正確なセグメントで Precision のテストを行ってください。
| 元映像のパターン | 最初にテストするモード | 確認すべきポイント |
|---|---|---|
| Bロール下でのナレーション;口が映らない | Audio Only | 翻訳内容、音声、ペーシング、ミックス |
| 中央に配置された1人のプレゼンター;顔が遮られていない | Speed | 子音のタイミング、歯の露出、最終音節 |
| 横顔、手や小道具による口の被覆 | Precision | 被覆下における唇の輪郭の安定性 |
| 2人の話者と頻繁なアングル変化 | Precision | 各カットにおける「声」と「顔」の正しく対応 |
この表は、HeyGen が公表しているモード説明に基づいており、制御されたベンチマークではありません。最初の候補が失敗した場合、元映像の修正または翻訳スクリプトの校正を行い、再度実行してください。より明瞭なクロップやクリーンな音源ミックスが、高モードへの切り替えよりも効果的である可能性があります。当社の HeyGen の代替ツールガイド では、プラットフォーム選択についても解説しています。
Audio Only はプロフェッショナルな選択肢になり得ます
リップシンクは、話者の口が視認可能な場合にのみ重要です。製品チュートリアルでは、翻訳の品質やキャプションの正確さの方が重要になることがあります。顔の動きを変更せずにダブリングを行うことで、承認済みの映像イメージを維持できます。Bロールに対して Precision のクレジットを消費するのは避けてください。話者が明確に映る「トークヘッド」セクションを分離し、個別にレビューしてください。
複数の話者は2つの異なるリスクを引き起こします
話者交代は、言語的リスクと視覚的リスクの2つを生じさせます。まず、各人物の意味とトーンを正確に保持し、次に正しい声を正しい顔に割り当てる必要があります。すべての話者交代箇所を確認してください。音声が重なる場合は、編集を簡潔にするか、別途承認済みのダイアログトラックを使用することを検討してください。

これは実際のモードテストではなく、あくまで概念図です。2人の話者が明確に映っているため、話者の交代(turn-taking)における割り当てが主な検討ポイントとなります。
バッチ処理の前に単一言語でのテストを実行する
最も厳しい条件(例:横角度での撮影、話者交代、または長い文)を含む20~40秒の抜粋を選択してください。容易なパイロットテストではリスクが過小評価されます。ソース動画のフレームレート、アスペクト比、および言語を記録してください。音楽が話者の声をかき回さないよう注意してください。
名前、用語、および許諾の準備
製品名、固有名詞、頭字語、法的表現、および翻訳してはならない語句をリストアップしてください。HeyGen のブランド用語集(Brand Glossary)は、用語の一貫性を保つのに役立ちます。話者が翻訳または音声再現について同意しているかどうか、および生成されたローカライズ済みメッセージが承認済みの原文と依然として一致しているかどうかを事前に判断してください。口パク同期(lip sync)を成功基準とする前に、話された全文スクリプトの意味を全体的に確認してください。すでに字幕がある場合は、その役割を理解してください:入力 SRT は翻訳のガイドとなり得ますが、HeyGen によれば、そのファイルの内容をそのまま再現するのではなく、依然として文言を再翻訳することがあります。
モードを選択し、最初の出力を検査する
「ビデオ翻訳(Video Translation)」でソース動画をアップロードし、1つのターゲット言語を選択した後、ショット表に従って Audio Only、Speed、または Precision のいずれかを選択します。パイロット版を生成し、通常速度で音声付きで再生して確認してください。以下の3つのタイミングを重点的にチェックします:最初の発話、中盤の話者交代またはカメラ切り替え、最終的な発話。困難な子音や話者交代の直前で一時停止し、タイムスタンプとエラーの種類(翻訳文の不適切さ、話者割り当てミス、タイミング誤差、口の変形、背景音の消失など)を記録してください。サムネイルが説得力があるからといって、そのクリップを承認してはいけません。
以下に示す実際の動く Seedance 対話サンプルは、完成したトークヘッド(talking-head)クリップの検査方法 を実証するために含まれており、HeyGen の結果を主張したり、エンジン間の比較を行うためのものではありません。まず音声の連続性を聴き、次に口の動きのタイミングと次のビートへのカットを視覚的に確認してください。この検査手法は、実際のローカライズ済みレンダリングにも同様に適用されます。
これは検査用の例として用いられる Seedance 出力であり、公式の HeyGen 翻訳テストではありません。
スケールアップ前に校正する
文が誤訳されている場合、ご利用のプランでサポートされていれば、HeyGen の「校正(Proofread)」または「レビュー&編集(Review & Edit)」ワークフローをご利用ください。これはスクリプト制御のステップであり、視覚的検査の代わりにはなりません。HeyGen によれば、「校正モード」で使用される出力 SRT は、その通りに読み上げることが可能です。一方、翻訳前に提出されたソース SRT は単なるガイドにすぎません。パイロットテストが合格したら、承認済みの文言を記録し、その後で他の言語へ拡張してください。生成されたクリップ間で音声の連続性を確保するための包括的なチェックリストについては、当社のSeedance 音声一貫性ガイドをご参照ください。
最初のレンダリングだけではなく、クレジット計算と再作業を実施する
ヘルプセンターに掲載されているクレジット料金に基づくと、2分間のソース動画を1言語に翻訳する場合、Audio Only では8クレジット、Speed では12クレジット、Precision では20クレジットが必要です。5言語への翻訳では、これらの初期合計値を5倍します。有用な予算は単に最初のパスだけではありません:校正による修正、口パク同期に失敗したセグメント、および新たにカットが必要となる言語のための余裕も考慮してください。購入前に現在のアカウント料金および最低課金単位の挙動を確認してください。本例は単純な算術計算であり、すべてのプランに対する正式な見積もりではありません。
実用的なワークシートには4つの列があります:ソース動画の分単位時間、ターゲット言語数、選択したモード、および想定される再実行回数。まず代表的な1言語で試行してください。Speed が困難なセクションを通過した場合、コストを抑えたバッチ処理が合理的かもしれません。Speed が横顔の挿入部分のみで失敗した場合、その挿入部分を編集するか、別途処理するバージョンに Precision を予約してください。ソース自体が不明瞭な場合、より高ランクのティアで再レンダリングしても、原因の根本解決にはならず、コストだけが増大します。
モードを切り替える前に問題を修正する
口のタイミングがずれているが、文言は正しい。 顔の可視性、フレームのカット、および話すペースを確認してください。Speed から始めている場合、難易度の高い「顔が明確に見える」抜粋に対して Precision を試してください。口の動きが実際の成果物に含まれない場合は、Audio Only を使用してください。
意味または発音が間違っている。 まずスクリプト、用語集、またはソース音声を修正してください。口パク同期エンジンは、誤ったテキストを救うことはできません。
間違った人物が話しているように見える。 話者交代(speaker handoffs)を再確認し、話者ごとに明確に分離された編集を検討してください。
画面上のテキストは、別途専門的な検査を要します。HeyGen の「ビデオ翻訳」ヘルプによれば、このツールは話された音声およびオプションで口の動きを翻訳しますが、埋め込まれたタイトル、グラフィックス、ハードコードされた字幕は対象外です。ローカライズ済みのタイトルカードおよび字幕は、別個のアセットとして計画してください。固定された映像の吹き替えではなく、新しいローカライズ済みショットを必要とするキャンペーンの場合、テキストから動画を生成する(text-to-video) が、元の映像を翻訳エンジンで書き換えるよりも適切な出発点となる可能性があります。
Seedance Agent が多言語キャンペーンにおいて果たす役割
HeyGen Speed および Precision は、特定の作業——すなわち、既存の動画を翻訳し、音声と(選択された場合)可視化された口の動きを同期させる作業——に対応しています。一方、Seedance Agent は異なる制作課題に対応します。各市場で異なるオープニング、製品ショット、背景、またはコール・トゥ・アクションが必要な場合、作業は一連の依頼事項、参照資料、承認プロセス、および再実行へと変化します。承認済みの台本とショットリストを用いて、これらのローカライズされたバリエーションを計画してください。レビュー中に、エージェントには製品の形状、キャラクターの同一性、およびテンポを一貫して維持するよう依頼します。ただし、これは HeyGen の Precision スイッチを Seedance 制御に変換するものではありません。
Seedance 対応言語ガイド では、完成済みのソース動画へのダビングとは明確に区別される、ネイティブな多言語生成について説明しています。すでに強い静止画があり、それに動きを付与する必要がある場合は、画像から動画へ(image-to-video)のワークフローが別の有用な制作手法となります。実際の作業内容に応じて、以下のいずれかを選択してください:承認済みのパフォーマンスを翻訳・維持する、あるいは協調的なレビューを伴う新規のローカライズシーンを作成する。
結論
HeyGen の翻訳においては、話す口の描写が不要な場合は Audio Only を、シンプルな可視プレゼンター向けには Speed を、プロフィールビュー、被写体の遮蔽(オクルージョン)、または話者切り替えが必要な場合は Precision を使用してください。最も難しい20~40秒の区間を1言語で試験的に実行し、意味の校正を行い、口の動きと音声の連続性を確認した後、承認済みバージョンのみをスケールアップしてください。モード名は処理時間の保証を意味せず、追加のクレジットによって不適切なソース素材や誤った台本を修正することはできません。キャンペーンが単なるダビングではなく、市場固有の新規シーンを必要とする場合、Seedance Agent を用いて制作を計画し、承認済みの台本をクリエイティブ・ブリーフに持ち込んでください。
自分でも試してみますか?
このガイドの手順をSeedanceでそのまま試し、プロンプトや画像を数分で完成度の高い動画に変えましょう。
登録で無料クレジット。プランは月額$20から。
Higgsfield Cinema Studio カメラ設定:実践的なショットガイド
Higgsfield Cinema Studio で焦点距離、絞り、照明、カメラ移動を設定する方法を、再現可能なショットカード、実践的な例、およびレビュー用チェックリストとともに解説します。
記事を読む
ComfyUI クラウド動画ワークフロー:人物、モーション、オクルージョンの制御
リードアクションと背景モーションを分離し、オクルージョンを制御し、顔を保護し、レビュー可能なグループシーンを生成する ComfyUI クラウド動画ワークフローを構築します。
記事を読む
MiniMax H3 クラウド GPU ベンチマーク:速度、コスト、および VRAM
レンダリング時間、承認済みクリップあたりのコスト、VRAM の余裕容量、コールドスタート、信頼性をカバーする再現可能なテスト計画を用いて、MiniMax H3 向けのクラウド GPU オプションを比較します。
記事を読む