一个优秀的 AI 视频通常不是从一长串形容词开始的。它从方向开始。
如果您的提示词只说"一个在东京散步的电影质感女性",模型必须决定这位女性的样子、她如何行走、摄像机位置、如何移动、时间是何时,以及场景是否有对话、环境音或寂静。每个未定义的选择都会为输出偏离您想象的方式创造另一个机会。
最可靠的 AI 视频提示词 表现得更像紧凑的镜头简介。它告诉模型屏幕上有什么、一段时间内会发生什么变化、摄像机如何观察它、视觉语言应该是什么,以及观众应该听到什么。
这份 AI 视频提示词指南 为您提供了一个可重用的结构来编写更好的提示词,然后展示如何针对 AKOOL 上的 Kling 3.0、Wan 2.7、Veo 3.1 和 Seedance 2.0 进行调整。
优秀 AI 视频提示词的解剖学
最简单有用的框架是:
主体 → 动作 → 摄像机 → 风格 → 声音
在编写 文本到视频提示词 时,按照该顺序使用这五个组件。您不需要为每一次生成编写详尽的段落;您需要足够的信息来消除最重要的歧义。
1. 主体 — 我们在看什么?
用视觉细节确定人物、产品、对象或环境。
薄弱:
一个城市里的女人。更好:
一位三十出头、穿着深红色风衣的女性独自站在夜间东京市中心的雨湿街道上。不要描述所有可见的细节。优先考虑身份锚点 — 衣着、材质、颜色、年龄、产品形状或应该保持稳定的其他特征。
2. 动作 — 镜头期间会发生什么变化?
视频需要时间指令。使用具体的动词并描述一个可理解的运动弧。
薄弱:
一双电影质感的运动鞋。更好:
一双白色跑鞋落在湿润的人行道上,撞击时压缩,然后当跑步者推离时向外溅水。避免将六个不相关的动作堆积到一个五秒钟的镜头中。更多指令不会自动产生更多控制。
3. 摄像机 — 我们应该如何看到这个动作?
当取景和运动很重要时,明确说明它们。
薄弱:
动态摄像机。更好:
低角度中等特写镜头。摄像机在跑步者旁边跟踪,然后在鞋撞击人行道时缓慢推向鞋。有用的词汇包括广角、中景、特写、俯视、低角度、手持、推车、跟踪镜头、环绕、平移、倾斜、柔焦和缓慢推进。
当单独的文本无法可靠地再现复杂的运动时,参考驱动的工作流通常更精确。AKOOL 关于 使用视频参考控制运动和风格 的指南解释了现有的片段如何可以指导摄像机运动、动作和氛围,而不是用语言描述所有内容。(Akool)
4. 风格 — 镜头应该感觉如何?
描述光照、调色板、纹理、流派和摄影处理,而不是依赖于"电影质感"这个词。
与其:
电影质感广告。尝试:
高端运动广告风格、冷蓝色阴影、温暖的实用光线、湿润的反射人行道、高对比度、浅景深、收敛的胶片颗粒。具体的视觉关系为模型提供了比"史诗"、"专业"或"4K 杰作"等通用质量标签更有用的信息。
5. 声音 — 我们应该听到什么?
对于具有原生音频的模型,声音应该从一开始就出现在提示词中。
例子:
音频:快速的脚步声在湿润的沥青上,每一步都有水溅,远处交通,低沉的脉动电子贝斯。没有对话。如果需要对话,保持简短并清楚标识该句:
女性看向镜头说,"我们才刚开始。"
音频:她的声音后面有安静的城市环境音和轻雨。Kling 向集成视听生成的演进始于 3.0 之前;AKOOL 的 Kling 2.6 原生音频 概览涵盖了同步对话、环境音和效果作为同一生成过程的一部分。(Akool)
模型特定的提示词技巧
五部分框架在各种模型上都有效,但相同的 视频生成提示词 不会总是产生相同的行为。不同的模型奖励不同类型的指导。
AKOOL 还支持统一的生成/编辑模型,例如 Kling O1;当您的工作流将提示词与参考资料、镜头扩展或自然语言编辑相结合时,了解那些 Kling O1 功能 是有用的。(Akool)
为多镜头故事叙述和角色一致性提示 Kling 3.0
当您的提示词描述短序列而不是一个静态构图时,Kling 3.0 特别有用。AKOOL 记录了 3–15 秒生成、原生音频、增强的主体一致性,以及可以从单个描述结构宽景、特写和切换的 AI Director 风格系统。(Akool)
对于 Kling 提示词指南 思维方式,按顺序描述故事情节。告诉模型那些情节之间保持的常数。
例子:
15 秒电影质感咖啡广告。
镜头 1:宽景日出时的安静厨房。一位穿着奶油色毛衣的女性进入画面并在柜台上放置一个黑色陶瓷马克杯。
镜头 2:中等特写镜头。她将新鲜咖啡倒入同一个马克杯;蒸汽上升穿过温暖的晨光。
镜头 3:她的手抬起马克杯,然后切到第一口后她在微笑的特写镜头。
在每个镜头中保持同一位女性、奶油色毛衣、黑色马克杯、厨房布局和温暖琥珀色的分级。
音频:柔和的咖啡注入声、陶瓷在木头上接触、安静的早晨房间音、微妙的原声乐。重要技术是连续性语言:明确识别哪个角色、衣着、道具或环境应该保持不变。参见 Kling 3.0 多镜头故事叙述 了解该模型的多镜头、原生音频和参考功能。(Akool)
为运动和风格化控制提示 Wan 2.7
Wan 2.7 最好用清晰定义的运动路径加稳定的视觉处理来方法。AKOOL 的发布预览强调更自然的运动、更强的风格化、一致性、开始/结束帧控制、参考输入和基于指令的编辑。(Akool)
与其添加五个竞争风格,建立一个艺术方向并解释运动如何演进。
例子:
一辆红色复古跑车从左边进入并沿着蜿蜒的海岸道路加速。摄像机开始于低前三分之一跟踪镜头,在驾驶员车门旁移动,然后当汽车驶离曲线时逐渐落后。
1970 年代欧洲公路电影美学、略微饱和度降低的青色阴影、温暖的阳光、细微的胶片颗粒、逼真的悬架运动和轮胎接触。在整个过程中保持相同的红色油漆、汽车比例和色级。当选定的工作流提供参考或关键帧控制时,使用它们而不是将每个外观约束都放入散文中。Wan 2.7 运动控制 的概览涵盖了其运动、风格一致性、参考和开始/结束帧方向。(Akool)
为电影逼真提示 Veo 3.1
Veo 3.1 对连接主体、动作、环境、摄像机和声音的类似剧本的自然语言反应良好。AKOOL 的 Veo 指南推荐了一个结构,结合电影风格、角色细节、运动、环境/光照、音频提示和技术摄像机方向。(Akool)
使用物理因果关系而不是断开的关键词字符串。
例子:
一位疲惫的厨师在午夜后关闭一家小餐厅。他关掉最后的吊灯并走向后门,因为房间一次一个部分地陷入黑暗。
缓慢向后推车至眼睛水平,50mm 电影视角,自然手持微运动。温暖的钨光过渡到来自小巷的冷蓝光。
音频:金属椅子轻轻刮擦、冰箱嗡嗡声、远处汽车经过、最后灯开关的点击。Veo 在摄像机方向和声音是同一场景逻辑的一部分时特别有用。AKOOL 目前将 Veo 3.1 描述为支持参考引导的一致性和精确运动控制。(Akool)
为音频同步视频提示 Seedance 2.0
Seedance 2.0 受益于超越单纯文本的思考。AKOOL 的当前视频生成界面列出了 Seedance 2.0,而其模型覆盖强调了文本、图像、视频和音频参考的多模态使用。
当音乐或语音建立时序时,围绕节拍结构编写提示词。
例子:
创建一个快速的 12 秒街装视频,与上传的节拍同步。
0–3 秒:模型在地铁灯下静止不动;缓慢推进。
3–6 秒:在第一个强节拍上,切到低角度行走镜头。
6–9 秒:当模型转向镜头时,快速侧跟踪镜头。
9–12 秒:夹克徽标的特写镜头,恰好在最后节拍处结束。
保持相同的模型、黑色夹克、银色配饰、地下车站设置和绿色荧光照明。
使用上传的音频作为时序参考。切割和主要身体运动应与最强的节拍对齐。对于 Seedance,参考可以携带信息,否则会使文本提示词变得不必要的冗长。让图像建立外观、视频建立运动、音频建立节奏;使用文本来解释这些元素应该如何相互作用。
常见的提示词错误(以及如何修复它们)
错误 1:编写图像提示词而不是视频提示词。
"大理石上的奢侈手表,电影质感光照"描述的是外观而不是时间。
修复:
大理石上奢侈手表的宏观特写镜头。秒针平稳移动,同时摄像机执行缓慢的 20 度环绕。狭窄的光扫过抛光的挡风板,逐渐揭示反射。错误 2:在一个镜头中要求太多。
如果主体运行、跳跃、换衣服、进入汽车、开车离开并在八秒内到达另一个城市,模型必须压缩太多状态变化。
修复:将概念分成多个镜头或使用支持多镜头的模型。
错误 3:使用含糊的摄像机语言。
与其:
酷炫的电影质感运动。写:
中景镜头。缓慢手持推进,同时主体保持居中;轻微的自然操作员运动,无环绕也无变焦。错误 4:自相矛盾。
"静止锁定摄像机"和"动态扫过摄像机运动"不应该出现在同一指令中,除非它们描述不同的镜头。
错误 5:重新描述上传的图像而不是描述运动。
对于图像到视频,让图像建立已经存在的内容。
更好:
主体缓慢转向窗户并微笑。窗帘在微风中轻轻移动。摄像机后退一米,同时保留原始光照、衣着、面部身份和房间设计。10 个现成的提示词模板
1. 产品广告 — 高级英雄镜头
一个 [产品] 坐在 [表面] 上。[产品动作]。宏观特写镜头过渡为缓慢的三分之一环绕。[光照] 在产品上创建受控反射。高端商业风格、[颜色调色板]、逼真的材料。音频:[音效]、细微的 [音乐风格]。2. 产品广告 — 生活方式演示
一个 [目标用户] 在 [环境] 中使用 [产品]。用户 [主要动作],清楚地展示 [好处]。中等跟踪镜头接着产品使用的特写镜头。自然 [一天的时间] 光照、正宗的生活方式广告风格。音频:环境环境音加微妙的向上音乐。3. 产品广告 — 三镜头社交广告
为 [产品] 创建一个 12 秒的三镜头广告。
镜头 1:[钩子]。
镜头 2:[产品好处在行动]。
镜头 3:[英雄镜头/行动召唤视觉]。
在所有镜头中保持相同的产品设计、颜色、环境和光照。快速但干净的过渡。音频:[音乐] 与同步的产品音效。4. 解释者 — 视觉概念
使用 [主体/对象] 以视觉方式显示 [概念]。从 [初始状态] 开始,然后演示 [变化],以 [结果] 结束。干净的中等宽景镜头,带缓慢推进。最小现代视觉风格、中立背景、清晰对象分离。音频:平静的旁白空间,带轻微环境音。5. 解释者 — 主持人场景
一位 [主持人描述] 站在 [设置] 并解释 [话题]。中景镜头、眼睛水平摄像机、非常缓慢的推进。主持人自然地打手势,同时说:"[简短对话]。"专业柔和光照、干净背景、收敛品牌颜色。音频:清晰的语音,带微妙的房间音。6. 社交片段 — 快速钩子
竖直 9:16 社交视频。立即在 [意外动作/视觉钩子] 上打开。手持特写镜头,在第一秒快速推进,然后当 [主体动作] 时稳定为中景镜头。高能量当代风格。音频:尖锐的开口音效,接着 [音乐类型]。7. 社交片段 — 变换
以 [之前状态] 开始。主体执行 [触发动作]。在运动期间,同时保持主体的身份和位置,将场景转换为 [之后状态]。摄像机通过过渡执行平滑的半环绕。音频:上升的过渡声音,在强节拍处结束。8. 电影短片 — 对话节拍
夜间内部。[角色 A] 在 [位置] 坐在 [角色 B] 的对面。以安静的双人镜头开始,然后缓慢推向角色 A,当他们说:"[句子]。"时。角色 B 做出反应而不说话。低关键性的自然光照、实用灯、浅景深。音频:收敛的房间环境音和自然对话。9. 电影短片 — 动作镜头
[角色] 穿过 [环境] 奔跑,同时 [威胁/事件] 在他们身后展开。低角度跟踪摄像机在角色旁边保持步调,然后在最后运动中摇晃到身后。逼真的重量、动力、碎片和接触物理。戏剧性的方向光照。音频:脚步声、呼吸、环境影响、没有音乐。10. 电影短片 — 大气建立镜头
[位置] 在 [时间/天气] 的广角建立镜头。[小环境动作] 在整个画面中创建微妙的运动。摄像机执行缓慢的起重机前进和下降,揭示 [故事细节]。[电影风格]、[颜色调色板]、逼真的体积氛围。音频:分层环境环境音,带远处 [特定声音]。这些模板是起始结构,不是魔法公式。用具体信息替换括号、删除不需要的部分,并一次测试一个变量。

