ナレーションと字幕:AI動画に音声を追加する方法
トーキングヘッドモードにはTTS音声と口元の同期が標準搭載。通常のテキスト→動画ではナレーションと字幕を自分で追加する必要があります。
始めたばかりのころ、こんな疑問はありませんか。「AIが生成する動画にナレーションは付いてくるの?」「字幕は自分で付けるの?」答えは使う生成モード次第です。トーキングヘッドモードでは、音声と口元の同期をモデル内部で自動生成します。一方、通常のテキスト→動画は映像のみで、ナレーションも字幕も付きません。このガイドでは両方のケースと、字幕をどこで追加するかを説明します。
トーキングヘッドモード:参考画像1枚でナレーション付きのプレゼンター動画を生成
トーキングヘッドモードは、デジタル人形の参考画像を1枚指定するだけで、1人が話す動画を生成します。ナレーションは内蔵TTSが自動生成し、口元の同期もモデル内部で処理されるため、別途音声を録音したり手動で合わせたりする必要はありません。なお、複数人のシーンや高度なモーションライブラリはHeyGen、Synthesia、D-IDなどの外部プラットフォームで提供されており、本サイトのトーキングヘッドモードには含まれません。
通常のテキスト→動画:デフォルトではナレーションなし
テキストプロンプトを動画にするだけで、画面内に誰も話していない場合は、自動音声も字幕も生成されません。純粋な映像のみが出力されるため、ナレーションと字幕は編集ツール側で自分で処理します。生成制限にもご注意ください:1クリップあたり最長15〜20秒、解像度720p、レート制限は毎分16リクエストです。
字幕はどうやって追加する?
通常のテキスト→動画には字幕が付いていません。CapCutやPremiereなどの編集ツールで書き出し後に字幕を焼き込みましょう。最初から字幕が欲しい場合は、トーキングヘッドモードに切り替えてください。このモードの動画にはナレーションと同期した字幕が付いています。
デモで試してみる
オンラインのDemoとStudioの両方にトーキングヘッドの入り口があり、/api-docsで完全なAPIも公開されています。今すぐ1枚の画像からナレーション付きのプレゼンター動画を生成しましょう。
Demoを試すVoiceover & Subtitles References
The TTS voiceover, lip-sync, and subtitle-burning approaches on this page reference the following industry products and open-source tech.
- HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)
Digital-human platforms like HeyGen mentioned here are described per their official product docs.
- ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)
For DIY voiceovers, ElevenLabs is a mainstream AI TTS option; its voices and language support follow its official site.
- Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)
For auto subtitle transcription, OpenAI's open-source Whisper model is a reference implementation.
- CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)
The subtitle-burning features of editors recommended here (Jianying/CapCut, etc.) follow their official docs.
信頼性について
この記事は第一線の実践者によって書かれており、主観的な印象による結論ではなく、arXiv論文、メーカー技術報告書、Stanford AI Indexなどの一手のソースをクロスチェックして書いています。
SandGrid@lcy362
Agnes Video Generator 開発者 · フルスタックエンジニア
オープンソースAIビデオ生成ツール「Agnes Video Generator」の著者、インディーズ开発者。プロジェクトはAgnes AIの完全に無料のビデオモデルに基づいており、MITプロトコルはオープンソースで、すでに1,000人以上のクリエイターがゼロコストでAIビデオを生産したことがある。長期にわたってビデオ生成モデルのエンジニアリングと普及に注目しており、記事の内容はすべて第一線の実践と一手の研究から来ています。
GitHub で見る最終更新:2026-08-21