- ブログ
- Pictory でテキストを使って動画を編集:文字起こしから録音をカット
AI Overview
Pictory は、テキストを削除することで既存の動画を編集できますか?
はい。Pictory はアップロードされた録画を文字起こしし、その文字起こしから単語や文を削除すると、対応する音声区間が動画から除去されます。
文字起こしのテキストを修正しても、発話された音声は変化しますか?
いいえ。Pictory では、削除操作のみが動画に影響を与え、それ以外の文字起こし編集(例:単語の修正)は字幕にのみ反映されます。単語を修正しても、話者が別の単語を発話するようにはなりません。
自動フィラー語削除を実行する前に確認すべき点は何ですか?
すべての提案されたカットを、文脈全体で確認してください。「あのう」「えーと」などのフィラー語、反復、一時停止、ディスコース・ワード(会話の流れを支える語)には、タイミング、強調、あるいは意味上の役割がある場合があり、そのまま残す必要があります。
テキスト編集後にBロールやブランディングを追加できますか?
はい。文字起こしによるカット後、「動画のカスタマイズ」を選択してストーリーボードへ進み、ビジュアル、音楽、シーン、キャプション、ブランディングなどを調整できます。
文字起こし編集で達成したい目的を明確にする
Pictory の「テキストによる動画編集」ワークフローは、インタビュー、チュートリアル、ウェビナー、ポッドキャスト、 testimonial(体験談)、画面共有プレゼンテーションなど、話された内容を含む録画に最も適しています。Pictory は音声を時間軸に沿った文字起こしに変換します。ユーザーは検索・選択・削除によって文字起こしの区間を操作し、対応する動画範囲を除去します。これにより、ラフカットがまるで文書編集に近い感覚になりますが、文字起こしはあくまで時間軸ベースのメディアを制御するためのインターフェースです。
アップロード前に、完成形の要件を明確にしてください。フルレングスの清潔なレッスンには、控えめなカットと自然な呼吸間隔が必要です。2分間のハイライトには明確な主張が必要で、完全な脱線部分を削除できます。ソーシャル向けクリップには、素早く引きつけるオープニング、1つの自己完結型のアイデア、そして欠落した文脈に依存しないエンディングが必要です。目標長、対象視聴者、配信フォーマット、および視聴者が必ず記憶すべき1文を明記してください。
元の録画は一切触れないでください。ファイル名、再生時間、言語、フレームレート、音声品質、および絶対に残さなければならないセクションを含む「ソース一覧」を作成してください。自動文字起こしが誤認識しやすい固有名詞、専門用語、引用文、数字などをメモしておきましょう。これらのメモは、最初の文字起こしが表示された後の「受入チェックリスト」となります。

オリジナルの参考画像。はっきりとした発話、安定した構図、クリーンな音声は、文字起こしベースの編集にとってより信頼性の高い基盤を提供します。
既存の録画を短縮するのではなく、新たにパフォーマンスを生成する場合は、テキストから動画を生成するワークスペースから始めます。静止画から構成されるソース映像の場合は、編集の組み立てに先立ち、画像から動画を生成するワークフローを使用してください。
録画のアップロードと文字起こしの検証
Pictory のホーム画面から「AIによる動画編集」を選択し、動画または音声ファイルをアップロードします。文字起こしの前に話されている言語を選択してください。Pictory の公式ガイドでは、録画が米国英語以外の言語で行われている場合、デフォルト設定の「English US」を変更することを推奨しています。処理はバックグラウンドで継続され、完了したプロジェクトは左側に文字起こし、右側にプレビューが表示された状態で開きます。
文字起こしが読み込まれた直後に削除を開始しないでください。最初の1分間を再生し、すべての文を話者の発話と照合してください。その後、中間と終盤にジャンプして、タイミングのずれがないか確認します。固有名詞、専門用語、数字、および明らかに認識ミスがある箇所を修正し、字幕の正確性を確保します。Pictory が明記している区別を忘れないでください:文字起こしのテキストを「削除」すると動画が変化しますが、「修正」や「置換」は字幕テキストのみを変更し、元の音声には影響しません。
カットする前に、該当区間をマークしてください。シンプルな分類システムを活用しましょう:「保持」「任意」「削除」「確認必要」。文字起こしが不明瞭な場合、複数人が同時に話している場合、または文が一時停止をまたいで続く場合などは、「確認必要」としてマークします。このレビューにより、次のアイデアの冒頭が誤って削除されるのを防げます。

参考画像(Pictory の実際のスクリーンショットではありません)。テキスト選択を編集コマンドとして使用する前に、文字起こしの正確性と時間軸の整合性を確認してください。
検索機能は、繰り返し出現するフレーズ、スポンサーセクション、事務連絡、質問、特定のトピックなどに有効です。ただし、各検索結果の前後におけるトランジションを実際に視聴することを代替できません。文字起こしは単語の出現位置を特定できますが、編集後の映像・音声が滑らかに接続されるかどうかは、再生して初めて確認できます。
完全な思考単位を削除してラフカットを作成する
まず、大規模で明確な削除から始めましょう:導入部の雑談、繰り返しの説明、無関係な逸脱、長すぎる技術的遅延、および成果物の要件外のセクションです。可能であれば、常に「完全な思考単位」を削除してください。半分の文をカットすると、文法的な不自然さ、手の位置の不一致、あるいは音声のクリックノイズが生じる可能性があります。
外側から内側へと作業を進めます。まず全体のセクションを削除し、次に文を緊密化し、最後に個々のフィラー語を検討します。各カットの前後数秒を必ずプレビューしてください。話者の口の動き、手の動き、姿勢、カメラの構図、部屋の残響音、会話のリズムを観察します。文字起こし上では正しく見えても、実際にはジャンプカットや背景音の急激な変化が露呈することがあります。自動的なフィラー語および無音の検出によりレビュー作業を加速できますが、各提案は意図的に承認してください。一時停止はトランジション(場面転換)を示す場合があります。単語の繰り返しは感情を表すことがあります。「so」や「well」などの語は、回答と質問をつなぐ役割を果たすことがあります。周囲の音声が自然に接続され、かつそのフィラー語が意味を追加しない場合は、それを削除してください。

説明用のテキスト編集ワークステーション。文字起こしの削除は実際のタイムライン上のカットと同等に扱い、すべての接続点付近の映像、発話、周囲音を確認してください。
これは実際の Seedance モーションの例であり、Pictory による編集ではありません。口の閉じ具合、ジェスチャーの連続性、ルームトーン(部屋の残響音)を確認しながら、安全なカットポイントを発見する練習にご活用ください。
積極的なトリミングを行う前に、必ず1つコピーを保存してください。短くカットしたバージョンで論理が失われる場合は、元の文字起こしから再構築するのではなく、控えめな編集と比較してください。最終的な再生時間を事前に記録しておいてもよいですが、数値に正確に収めることよりも、理解のしやすさを優先してください。
ジャンプカット、キャプション、シーントランジションの修復
文字起こし編集は、シングルカメラのトークヘッド映像において自然とジャンプカットを生じさせます。中には許容でき、教育コンテンツに活力を与えるものもあります。一方で、隣接するフレーム間で話者の位置が急激に変化するため、視聴者にとって気になりやすいものもあります。困難なカットは、関連性のあるBロール、スライド、画面の詳細、あるいは意図的に構図されたクロップでカバーしてください。単に接続点を隠すために、無関係なストックショットを使用しないでください。
ラフカットにビジュアル作業、音楽、イントロ・アウトロ、ロゴ、その他のブランド要素が必要な場合は、「動画をカスタマイズ」を選択し、Pictory のストーリーボードへ進んでください。視覚要素は、それが支える文と密接に関連している必要があります。製品の詳細は話者がそれを説明している最中に表示すべきです。グラフは読み取れる十分な時間表示されるべきです。タイトルカードは、思考の途中を遮ってはいけません。
すべての構造的カット完了後に、キャプションの行分割を再確認してください。意味を変えずに凝縮されたキャプションを作成し、人名や数字はまとめて表示し、顔や重要なオブジェクトを覆わないように注意してください。修正後の字幕は、実際に音声で話されている内容と一致しなければなりません。話者が本当に誤った単語を発した場合、字幕のみを修正すると信頼性の問題を引き起こす可能性があります。正確性が重要である場合は、該当部分を再録音または置き換えてください。
すべての削除箇所でルームトーンを確認してください。ノイズが急激に変化する場合は、連続したアンビエンスベッド(周囲音のバックグラウンドトラック)を追加するか、自然な一時停止地点でより広い範囲のカットを選択してください。終了環境が許す場合は、短いオーディオクロスフェードを使用してください。画面を見ずに音声だけを聞いて確認しましょう。クリック音、息の途切れ、背景のハム音の変化などは、視覚的な動きがない方が聞き取りやすくなります。
長尺録音を焦点の絞られた短尺版へと変換
要約とは、何が重要かについての編集上の主張です。まず、視聴者が果たすべき単一のタスクを明確にしてください:手法を学ぶ、結果を理解する、選択肢を比較する、次に何をするかを決める、などです。そのタスクに最低限必要な文脈を維持し、選択したセクションを「導入」「本論」「結論」の順に配置してください。
冒頭では、問題を素早く特定すべきです。本論では、証拠や手順を提示し、同じ要点を複数のバリエーションで述べてはいけません。結論では、提示された約束を果たし、次のアクションを明示してください。インタビューの回答が質問に依存する場合は、質問をそのまま残すか、簡潔なコンテキストカードを追加するか、文字起こしに基づくカット外で導入部を書き直してください。
縦型ソーシャル向けバージョンでは、リフレーミングによって話者や視覚的証拠が切り取られていないか確認してください。キャプションには安全なマージンと読みやすい表示時間が必要です。トレーニングモジュール向けには、結果として若干長くなるとしても、定義や注意事項を保持してください。販売ハイライト向けには、主張はその根拠と常に結びつけて保持し、オリジナルの文脈から外れた際に誤解を招く可能性がある発言は削除してください。
AI字幕ワークフローでは、字幕品質に関する補完的なチェックリストが提供されています。より一般的な連続性レビューには、動画の一貫性ガイド を使って、アイデンティティ、カメラ、モーション、編集トランジションを総合的に評価してください。
最終ストーリーボードのレビューとエクスポート
コントロールを一切操作せずに、通常速度で完全なプレビューを視聴してください。混乱を招くジャンプ、繰り返しの多いポイント、文脈の欠落、キャプションの誤り、無関係な映像、音楽との干渉、急激な音声変化などをメモしてください。その後、技術的欠陥にのみ焦点を当てた2回目の確認を行ってください。物語の承認と仕上げを分離することで、1つの魅力的なシーンが破綻した論理を隠すことを防ぎます。

説明用の最終レビュー。レンダリング前に、意味の正確性、カットの連続性、キャプションの正確性、映像の関連性、音声の接続、ブランド表現、開示事項を承認してください。
Pictory のエクスポートガイドでは、「動画を生成」機能と「動画をカスタマイズ」機能を区別しています。シーン、メディア、音楽、ブランド要素のいずれかにまだ変更が必要な場合は、「動画をカスタマイズ」を使用してください。レビュー済みのコピーが承認され、レンダリング準備が整った段階で「動画を生成」を使用してください。処理完了後は、プレビューとエクスポートが同一であると想定せず、ダウンロードしたファイル自体を検証してください。
解像度、アスペクト比、フレームレート、総再生時間、キャプションのスペル、音声の同期、最初と最後のフレームを確認してください。実際のファイルをデスクトップおよびスマートフォンで視聴してください。SRT、VTT、テキスト形式で下流チームが必要とする場合は、文字起こしまたはキャプションのエクスポートを保存し、主要な削除セクションをすべて記載したバージョンノートを保持してください。複数のカットを制作するチームにとって、Seedance Agent は、音源録音ファイル、字幕決定事項、Bロール参照素材、承認メモ、出力バージョンなどを整理・管理できます。ただし、編集上の判断を代替するものではなく、却下されたカットや古いキャプションファイルが後続の再放送時に静かに復活してしまうことを防ぐものです。
結論
Pictory でテキストを用いて動画を編集するには、まず明確な納品物を定義し、クリーンな録音ファイルをアップロードし、正しい言語を選択したうえで、編集面として使用する前に文字起こし結果を検証します。最初に完全な思考単位を削除し、映像と音声のすべての接続点を確認し、関連するカバレッジで目立つカットを修復し、発話内容を変更したかのように装わず字幕を修正し、レンダリング済みファイルを実機でレビューします。複数のソースクリップ、レビューステージ、SNS向けバリエーションなど、規模の大きなコンテンツパイプラインでは、Seedance Agent を用いて制作を調整してください。
自分でも試してみますか?
このガイドの手順をSeedanceでそのまま試し、プロンプトや画像を数分で完成度の高い動画に変えましょう。
登録で無料クレジット。プランは月額$28から。
関連記事
同じ言語で次に読みたい記事です。

AIビデオに複数ステップのアクションを実行させる方法
AIビデオが意図した順序で一連のアクションを完了できるよう、原子的アクションの計画、状態遷移、タイミング、連続性、およびショットの引継ぎを設計します。
記事を読む
ElevenLabs Voice Changer 動画チュートリアル:声を置き換え、パフォーマンスを維持する
ElevenLabs Voice Changer を使用して動画の台詞を変換し、感情とタイミングを保持し、リップシンクを復元し、アーティファクトのトラブルシューティングを行い、一貫性のあるミックスを仕上げます。
記事を読む
Runway Aleph Green Screen:キー可能な被写体とクリーンプレートの作成
Runway Aleph 2.0 を使用して通常の映像をグリーンスクリーン用アセットに変換し、正確なプロンプトを作成、結果をキーリング(クロマキー)処理し、エッジの問題を修正してクリーンプレートを作成します。
記事を読む