3.0.0 — 字幕与旁白独立控制 + AI 字幕样式 + 数字人口播 + 文生图
字幕与旁白独立控制 + AI 字幕样式 + 数字人口播 + 文生图
更新内容
新功能与改进
- 字幕与旁白独立控制 —
SubtitleConfig提升为AudioConfig的同级,各自有独立的enabled开关;四种组合模式(旁白+字幕、仅旁白、仅字幕、静音);创意与稿件接口新增subtitle_enabled参数。 - AI 字幕样式(LLM 模式) —
style_mode支持"fixed"(全局样式)或"llm"(每条字幕的位置/颜色/字号由 LLM 决定);style_hints接受自然语言指导(如“关键句用红色、总结用黄色”);generate_subtitle_styles()一次性把所有字幕发给 LLM,通过 sidecar 文件subtitle_styles.json渲染。 - 数字人口播任务类型 — 通过 t2i 或 i2i(用户上传参考照片)生成 AI 主持人;稿件按 5–12 秒段落切分,每段生成一个手势/表情不同的独立 i2v 片段;统一 TTS + LLM 优化字幕叠加;音频可来自模型或拼接后生成;接口
POST /api/tasks/anchor。 - 简易文生图 — 新增第五个标签页;轻量
SimpleImageTask;支持系统提示词;通过GET /api/image/{id}获取结果。 - 系统提示词支持 — 简易视频与图片任务支持可选系统提示词,前置拼接到最终提示词。
重构与优化
- 管线步骤拆分 — 创意与稿件管线中,
_step_audio_subtitle拆分为独立的_step_audio+_step_subtitle。 - 字幕渲染改进 — 多行显示(0.3 秒重叠)、0.8 秒转场重叠、两遍
extend-end时间轴、安全边距溢出保护、LLM 垂直区域定位带来视觉变化。
Bug 修复
subprocess.run添加stdin=DEVNULL,防止后台进程 SIGTTIN 挂起。SilentTTSEngine.generate()返回None→ 空dict,修复纯字幕模式 SRT 生成。- SRT 时间轴基于实际音频时长而非估算的视频时长。
- 图片生成失败时输出具体报错(HTTP status + body + traceback)。
- 数字人口播管线防御性 UTF-8 编码修复;TTS 先生成以获得实际音频时长。
关于 Agnes Video Generator
完全免费、开源的 AI 视频生成器:输入文字即可生成带旁白与字幕的多镜头 AI 视频。
- 完全免费开源,无需付费与高性能显卡
- 支持文字转视频、图片转视频、数字人口播、文生图
- 基于 Agnes AI 免费模型,视频全部在云端生成
- Web UI、Docker、npm 多种运行方式,支持自托管
相关页面
内容可信度说明
本文由一线实践者撰写,写的时候交叉核对了 arXiv 论文、厂商技术报告和 Stanford AI Index 等一手来源,不是凭主观印象下的结论。
S
SandGrid@lcy362
Agnes Video Generator 项目作者 · 全栈开发者
独立开发者,开源 AI 视频生成工具 Agnes Video Generator 的作者。项目基于 Agnes AI 完全免费的视频模型,MIT 协议开源,已经帮 1,000+ 创作者零成本产出过 AI 视频。长期关注视频生成模型的工程化和普及,文章内容都来自一线实践和一手研究。
访问 GitHub最后更新:2026-08-21