3.0.0 — 字幕与旁白独立控制 + AI 字幕样式 + 数字人口播 + 文生图

字幕与旁白独立控制 + AI 字幕样式 + 数字人口播 + 文生图

主版本发布于 2026年6月21日在 GitHub 查看

更新内容

新功能与改进

  • 字幕与旁白独立控制SubtitleConfig 提升为 AudioConfig 的同级,各自有独立的 enabled 开关;四种组合模式(旁白+字幕、仅旁白、仅字幕、静音);创意与稿件接口新增 subtitle_enabled 参数。
  • AI 字幕样式(LLM 模式)style_mode 支持 "fixed"(全局样式)或 "llm"(每条字幕的位置/颜色/字号由 LLM 决定);style_hints 接受自然语言指导(如“关键句用红色、总结用黄色”);generate_subtitle_styles() 一次性把所有字幕发给 LLM,通过 sidecar 文件 subtitle_styles.json 渲染。
  • 数字人口播任务类型 — 通过 t2i 或 i2i(用户上传参考照片)生成 AI 主持人;稿件按 5–12 秒段落切分,每段生成一个手势/表情不同的独立 i2v 片段;统一 TTS + LLM 优化字幕叠加;音频可来自模型或拼接后生成;接口 POST /api/tasks/anchor
  • 简易文生图 — 新增第五个标签页;轻量 SimpleImageTask;支持系统提示词;通过 GET /api/image/{id} 获取结果。
  • 系统提示词支持 — 简易视频与图片任务支持可选系统提示词,前置拼接到最终提示词。

重构与优化

  • 管线步骤拆分 — 创意与稿件管线中,_step_audio_subtitle 拆分为独立的 _step_audio + _step_subtitle
  • 字幕渲染改进 — 多行显示(0.3 秒重叠)、0.8 秒转场重叠、两遍 extend-end 时间轴、安全边距溢出保护、LLM 垂直区域定位带来视觉变化。

Bug 修复

  • subprocess.run 添加 stdin=DEVNULL,防止后台进程 SIGTTIN 挂起。
  • SilentTTSEngine.generate() 返回 None → 空 dict,修复纯字幕模式 SRT 生成。
  • SRT 时间轴基于实际音频时长而非估算的视频时长。
  • 图片生成失败时输出具体报错(HTTP status + body + traceback)。
  • 数字人口播管线防御性 UTF-8 编码修复;TTS 先生成以获得实际音频时长。

关于 Agnes Video Generator

完全免费、开源的 AI 视频生成器:输入文字即可生成带旁白与字幕的多镜头 AI 视频。

  • 完全免费开源,无需付费与高性能显卡
  • 支持文字转视频、图片转视频、数字人口播、文生图
  • 基于 Agnes AI 免费模型,视频全部在云端生成
  • Web UI、Docker、npm 多种运行方式,支持自托管

相关页面

内容可信度说明

本文由一线实践者撰写,写的时候交叉核对了 arXiv 论文、厂商技术报告和 Stanford AI Index 等一手来源,不是凭主观印象下的结论。

S

SandGrid@lcy362

Agnes Video Generator 项目作者 · 全栈开发者

独立开发者,开源 AI 视频生成工具 Agnes Video Generator 的作者。项目基于 Agnes AI 完全免费的视频模型,MIT 协议开源,已经帮 1,000+ 创作者零成本产出过 AI 视频。长期关注视频生成模型的工程化和普及,文章内容都来自一线实践和一手研究。

访问 GitHub

最后更新2026-08-21

准备好开始创作了吗?

「让世界级的 AI 属于每一个人。」—— Bruce Yang。完全免费,不用信用卡,也不要高性能显卡,零成本做出你的第一支 AI 视频。想用 Agnes AI 的免费视频模型?从这里开始就行。

克隆 GitHub 仓库,两分钟即可启动