五种模式的提示词写法
文生视频、创意长视频、稿件长视频、诗词视频、数字人口播——一页说清五种 Prompt 的写法
写提示词之前,先想清楚你要用哪种模式:文生视频(单段描述,也可附参考图锁定主体)、创意长视频(故事线 + 场景清单)、稿件长视频(整篇稿件自动拆段)、诗词视频(逐句拆分原诗生成画面)还是数字人口播(参考形象图 + 口播稿件,配音和字幕自动生成,详见「旁白与字幕」)。五种模式写法各有侧重,下面逐一拆开讲。所有模式都受同一套限制:约 16 次请求/分钟、最高 720p、单镜头最长 20 秒。
五种模式,五套写法
由模式决定写法重点,再套用通用要点。
通用写法要点
具体化描述
把一个笼统概念书写成画面。「一个女孩」不如「穿红裙的女孩在雨后的站台踮脚转圈」。能画出来的词,模型才看得见。
分句镜头语言
用句号和分号规划镜头与节奏:一句一个镜头、一个动作。别把三件事塞进一句话里。
像摄影师那样描述
写明光源、明暗、景深、机位:例如「暖黄侧光」「浅景深特写」「低机位仰拍」。光与机位对了,质感立刻上台阶。
开头一句定风格
在开头用一句话锁定整体风格,例如「赛博朋克霓虹」「水墨插画风」。风格定了,后续每个镜头都不会跑偏。
常见雷区
- 一段塞十个镜头
「爆炸+追逐+爱情」全挤进一句话,模型只能随机取一处,画面乱套。一次写一个镜头,多镜头交给创意模式。
- 只写形容词不写画面
「美、震撼、酷炫」不是指令,是评价。把它们翻译成光、镜、动作和构图,模型才拍得出来。
- 忽视主体一致性
连续镜头或多个场景中角色长相飘忽,往往是 Prompt 没给参考图、也没统一描述。给图或用参考图模式,是保证一致的手段。
打开 Demo 试一句
按上面的思路写一句 Prompt,粘贴进在线 Demo 立即生成。
立即体验 →提示词方法依据
本文提示词写法的底层依据,来自以下模型技术报告与提示词工程指南。
- VideoPoet: A Large Language Model for Zero-Shot Video GenerationGoogle Research · arXiv:2312.14125 (2023)
VideoPoet 论文展示了 LLM 驱动的视频生成对提示词结构的敏感性,是本页提示词技巧的学术依据。
- Sora: Video Generation Model Technical ReportOpenAI · OpenAI Technical Report (2024)
OpenAI Sora 技术报告详细描述了提示词工程对视频质量的影响,包括镜头语言、物理描述等最佳实践。
- OpenAI Prompt Engineering Guide — 提示词工程最佳实践OpenAI · OpenAI Docs (2025)
OpenAI 官方提示词工程指南提供了「具体、分步、给出约束」等通用方法论,与本页要点一致。
内容可信度说明
本文由一线实践者撰写,写的时候交叉核对了 arXiv 论文、厂商技术报告和 Stanford AI Index 等一手来源,不是凭主观印象下的结论。
SandGrid@lcy362
Agnes Video Generator 项目作者 · 全栈开发者
独立开发者,开源 AI 视频生成工具 Agnes Video Generator 的作者。项目基于 Agnes AI 完全免费的视频模型,MIT 协议开源,已经帮 1,000+ 创作者零成本产出过 AI 视频。长期关注视频生成模型的工程化和普及,文章内容都来自一线实践和一手研究。
访问 GitHub最后更新:2026-08-21