旁白与字幕:如何给 AI 视频加配音

数字人口播自带 TTS 配音与口型同步,普通文生视频则需要后期自行添加旁白与字幕。

很多刚上手的朋友会问:AI 生成的视频自带配音吗?字幕要自己加吗?答案取决于你用的是哪种生成模式。数字人口播模式会由模型内部直接生成配音与口型同步;而普通文字生成视频只有画面,没有旁白、也没有字幕。这篇指南把两种情况讲清楚,并告诉你字幕该在哪里加。

数字人口播模式:一张形象图就能出带配音的口播视频

数字人口播模式只需提供一张数字人形象参考图,模型即可产出单人说话的口播视频。配音由内置 TTS 自动生成,口型同步也由模型内部完成,不需要你额外配音或手动对齐。需要说明的是:多人场景、复杂的动作库等功能需要在 HeyGen、Synthesia、D-ID 这类外部平台上实现,本网站的人像模式暂不包含。

提示:使用单张数字人形象 + 内置 TTS 即可,无需额外配音工具。

普通文生视频:默认没有旁白

如果你只是用文字生成一段视频,画面里没有人讲话,那么默认不会自动生成配音,也不会自带字幕。这类视频只输出纯画面,后续的配音和字幕需要你自己在剪辑软件里完成。另外要注意生成限制:单段视频最长 20 秒、分辨率 720p、接口限速 16 次/分钟。

字幕怎么加?

普通文生视频没有字幕:导出后请用剪辑工具(如剪映、Premiere、CapCut)把字幕烧录到画面上。如果想要自带字幕,可以改用数字人口播模式——该模式生成的视频会同步输出与配音对齐的字幕。

去 Demo 里试一下

在线 Demo 与 Studio 都提供了数字人口播入口,/api-docs 也开放了完整 API。你可以直接用一张形象图生成一段带配音的口播视频。

前往 Demo 体验

配音与字幕技术参考

本文关于 TTS 配音、口型同步与字幕烧录的方案,参考以下行业产品与开源技术。

  1. HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)

    文中提到的 HeyGen 等数字人平台,其配音与口型同步能力以其官网产品说明为准。

  2. ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)

    若需自行配音,ElevenLabs 是主流 AI TTS 方案之一,其音色与多语言能力以官网为准。

  3. Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)

    自动字幕转录可参考 OpenAI 开源的 Whisper 模型。

  4. CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)

    文中推荐的剪辑工具(剪映 / CapCut 等)的字幕烧录功能以其官方文档为准。

内容可信度说明

本文由一线实践者撰写,写的时候交叉核对了 arXiv 论文、厂商技术报告和 Stanford AI Index 等一手来源,不是凭主观印象下的结论。

S

SandGrid@lcy362

Agnes Video Generator 项目作者 · 全栈开发者

独立开发者,开源 AI 视频生成工具 Agnes Video Generator 的作者。项目基于 Agnes AI 完全免费的视频模型,MIT 协议开源,已经帮 1,000+ 创作者零成本产出过 AI 视频。长期关注视频生成模型的工程化和普及,文章内容都来自一线实践和一手研究。

访问 GitHub

最后更新2026-08-21

准备好开始创作了吗?

「让世界级的 AI 属于每一个人。」—— Bruce Yang。完全免费,不用信用卡,也不要高性能显卡,零成本做出你的第一支 AI 视频。想用 Agnes AI 的免费视频模型?从这里开始就行。

克隆 GitHub 仓库,两分钟即可启动