旁白与字幕:如何给 AI 视频加配音
数字人口播自带 TTS 配音与口型同步,普通文生视频则需要后期自行添加旁白与字幕。
很多刚上手的朋友会问:AI 生成的视频自带配音吗?字幕要自己加吗?答案取决于你用的是哪种生成模式。数字人口播模式会由模型内部直接生成配音与口型同步;而普通文字生成视频只有画面,没有旁白、也没有字幕。这篇指南把两种情况讲清楚,并告诉你字幕该在哪里加。
数字人口播模式:一张形象图就能出带配音的口播视频
数字人口播模式只需提供一张数字人形象参考图,模型即可产出单人说话的口播视频。配音由内置 TTS 自动生成,口型同步也由模型内部完成,不需要你额外配音或手动对齐。需要说明的是:多人场景、复杂的动作库等功能需要在 HeyGen、Synthesia、D-ID 这类外部平台上实现,本网站的人像模式暂不包含。
普通文生视频:默认没有旁白
如果你只是用文字生成一段视频,画面里没有人讲话,那么默认不会自动生成配音,也不会自带字幕。这类视频只输出纯画面,后续的配音和字幕需要你自己在剪辑软件里完成。另外要注意生成限制:单段视频最长 20 秒、分辨率 720p、接口限速 16 次/分钟。
字幕怎么加?
普通文生视频没有字幕:导出后请用剪辑工具(如剪映、Premiere、CapCut)把字幕烧录到画面上。如果想要自带字幕,可以改用数字人口播模式——该模式生成的视频会同步输出与配音对齐的字幕。
去 Demo 里试一下
在线 Demo 与 Studio 都提供了数字人口播入口,/api-docs 也开放了完整 API。你可以直接用一张形象图生成一段带配音的口播视频。
前往 Demo 体验配音与字幕技术参考
本文关于 TTS 配音、口型同步与字幕烧录的方案,参考以下行业产品与开源技术。
- HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)
文中提到的 HeyGen 等数字人平台,其配音与口型同步能力以其官网产品说明为准。
- ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)
若需自行配音,ElevenLabs 是主流 AI TTS 方案之一,其音色与多语言能力以官网为准。
- Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)
自动字幕转录可参考 OpenAI 开源的 Whisper 模型。
- CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)
文中推荐的剪辑工具(剪映 / CapCut 等)的字幕烧录功能以其官方文档为准。
内容可信度说明
本文由一线实践者撰写,写的时候交叉核对了 arXiv 论文、厂商技术报告和 Stanford AI Index 等一手来源,不是凭主观印象下的结论。
SandGrid@lcy362
Agnes Video Generator 项目作者 · 全栈开发者
独立开发者,开源 AI 视频生成工具 Agnes Video Generator 的作者。项目基于 Agnes AI 完全免费的视频模型,MIT 协议开源,已经帮 1,000+ 创作者零成本产出过 AI 视频。长期关注视频生成模型的工程化和普及,文章内容都来自一线实践和一手研究。
访问 GitHub最后更新:2026-08-21