起始帧设定 AI 生成片段的第一张图像,而结束帧则定义想要的最终图像。视频模型负责生成二者之间的运动。结果取决于模型、提示词、图像的兼容性以及可用的控制项,因此提供两帧并不能保证物体或角色的完美连贯。
AI 视频中的起始帧与结束帧是什么?
起始帧与结束帧是两个视觉锚点,告诉 AI 视频模型一个镜头应如何开始、大致应在何处结束。随后模型会生成连接这两种状态所需的中间运动。
可以这样理解这个工作流:
起始帧 → 生成的运动 → 结束帧
例如:
- 起始帧:桌上一个合着的黑色产品盒
- 结束帧:同一个盒子打开、产品可见
- 提示词:在盒盖打开时缓慢向后拉镜头,保持盒子和 logo 不变
模型并不是简单地在两张图片之间做淡入淡出。它会尝试创造一段看起来合理的中间帧序列。
Google 在其 Veo 3.1 文档中把这称为插值(interpolation)。第一张图像作为初始帧提供,最后一张图像作为最终帧约束。Google AI for Developers
这与在文本中要求模型“以一个打开的盒子结尾”不同。文本可以描述一个结尾,而真正的起始/结束帧工作流提供的是实际的最终图像。
起始帧与结束帧和图像转视频有何不同?
图像转视频通常用一张图像锚定片段的开头。而起始/结束帧生成则同时锚定转场的两端。
| Workflow | Required input | What you control | Main continuity advantage | Common failure |
|---|---|---|---|---|
| Single-image image-to-video | One image + prompt | Starting appearance and motion direction | Strong first-frame identity | Ending can drift |
| Start + end frames | Two images + prompt | Beginning, intended ending, and transition direction | Both compositions are visually constrained | Middle can morph unnaturally |
| Video extension | Existing clip + prompt | Continuation after the existing endpoint | Carries motion forward | New section may drift |
| Video Reference | Reference clip + target asset | Motion/camera/style behavior | Better motion guidance | Target may inherit unwanted reference behavior |
AKOOL 的标准AI 视频生成器已经支持跨多个模型系列的图像转视频。重要的区别在于所选的具体模型及当前模式是否提供第二帧输入。
不要把诸如“以这个构图结尾”之类的文本指令称为起始/结束帧控制。第二张图像必须真正作为帧约束被提供。
如何选择能平滑转场的两帧?
你的起始图像和结束图像在主体身份、摄影机位置、构图、光照和画面比例上越接近,模型在二者之间需要凭空生成的视觉信息就越少。
有五个因素最为关键。
保持主体一致
如果第一张图像显示的是一个蓝色瓶子,而第二张显示的瓶形略有不同,模型就必须判断是让产品发生变形,还是忽略这一差异。
在两张图像中使用相同的角色、产品、服装、材质和关键细节。
匹配摄影机角度与取景
取景上的微小变化可以暗示一次可信的运镜。
从正面特写过渡到稍微更宽的正面镜头相对简单。
从正面特写过渡到俯拍镜头,则要求模型重建未被看到的表面,并凭空生成一条大得多的运镜路径。
保持光照兼容
日转夜的转场之所以可行,正是因为光照本就应当变化。
但如果你只想改变角色的姿势,大幅且不相关的光照差异就会给模型增加另一个需要解决的问题。
使用相同的画面比例
尽可能以相同的最终构图创建这两张图像。拉伸或裁剪其中一端会改变主体在画面中出现的位置。
避免不可能的姿势变化
如果一个人在开头是面向镜头坐着,而最终图像显示其在一个完全不同的房间里背对镜头站立,模型就必须凭空生成大量的运动和未被看到的视觉细节。
更简单的转场通常能更好地保持身份一致。
如何用 AKOOL 创建起始帧到结束帧的视频?
使用当前 AKOOL 工作流同时提供起始帧和结束帧的模型。AKOOL 的公开文档目前描述了 Kling 3.0 和 Wan 2.7 对起始/结束帧的支持,但在生成之前,仍应检查你账户中实际可见的控制项。
AKOOL 当前的 Kling 3.0 页面指出,其多参考工作流可以使用起始/结束帧来实现精确的运动。
AKOOL 的 Wan 2.7 页面则单独记录了用于定义镜头运动弧线的起始帧与结束帧控制。
一个实用的工作流是:
- 打开 AKOOL AI 视频生成器。
- 选择一个当前提供起始/结束帧输入的模型。
- 上传第一张图像。
- 把想要的最终图像上传到结束帧字段。
- 编写一段描述转场应如何发生的提示词,而不是描述这两张图像已经显示的内容。
- 让输出的画面比例与两张输入帧相匹配。
- 生成后,像检查开头和结尾一样仔细地检查片段的中间部分。
这两张图像约束的是两端,提示词说明的是路径。
如果你所选的模型不提供双帧输入,就改用它支持的图像转视频模式。不要仅仅通过在文本中描述结尾来模拟这一功能。
对于更复杂的摄影机或动作引导,AKOOL 的视频参考指南解释了一段现成片段如何引导运动与风格。
起始帧与结束帧适用哪些提示词范式?
产品揭示
当产品必须最终呈现为某个特定的主视觉构图时,使用起始/结束帧组合。
起始帧:密封的产品盒,近景取景。
结束帧:打开的盒子,产品居中。
Start on the supplied close-up of the sealed box. Move the camera back slowly as the lid opens. End at the supplied clean hero frame of the product. Keep the logo shape, package geometry, and product color stable. One continuous shot.
需要检查的内容:关注 logo、盒盖铰链、产品尺寸,以及内部开始可见的那一刻。
问题修正:减少摄影机运动的幅度,并要求盒盖以一个简单、连续的动作打开。
日转夜转场
当构图保持固定、而环境条件发生变化时,这种范式有效。
起始帧:白天的街道。
结束帧:夜晚的同一条街道。
Transition gradually from the supplied daytime street frame to the matching night frame. Keep all buildings, road geometry, and camera position fixed while the sky darkens and window lights turn on gradually. No cuts.
需要检查的内容:在光照变化时,建筑不应移动。
问题修正:明确锁定建筑结构,如果移动的车辆或人群带来了不想要的空间变化,就将其移除。
运镜
用两个相互匹配的构图来暗示一次可控的推镜、拉镜或局部环绕。
起始帧:产品中景。
结束帧:更近的产品四分之三视角。
Move smoothly from the supplied medium composition to the final three-quarter close-up. Use a slow clockwise camera move at constant height. Keep product proportions, logo, materials, and background unchanged.
需要检查的内容:这次转场应给人摄影机运动的感觉,而不是产品在变形。
问题修正:缩小两张源帧之间的角度差异。
角色姿势变化
小幅度的姿势变化比大幅度的身体变换更容易实现。
起始帧:一个人站立,双臂放松。
结束帧:同一个人在胸前位置拿着一个杯子。
Keep the character's face, clothing, hairstyle, and body proportions unchanged. The right arm lifts naturally to pick up the cup and reaches the supplied final pose. Camera remains fixed. No change to lighting or background.
需要检查的内容:手指、手臂长度、面部身份、杯子位置以及衣物褶皱。
问题修正:简化手部交互,或改用一个更大、对手指精细动作要求更低的物体。
场景变换
起始/结束帧组合可以引导一次风格化的环境变换,但大幅度的场景变化带来的变形风险最高。
起始帧:空旷的未来感广场。
结束帧:覆盖着积雪的同一个广场。
Keep the camera position, architecture, and plaza layout fixed. Snow gradually begins falling and accumulating until the scene matches the supplied winter frame. Buildings must not change shape. No cut or camera movement.
需要检查的内容:在表面发生变化时,建筑结构应保持固定。
问题修正:将光照/天气的变化与建筑结构的变化分开。避免要求模型同时变换环境和摄影机。
起始帧与结束帧可能出什么问题?
两端可能是正确的,而生成的中间部分仍然失败。大多数问题都源于要求模型去调和在太多方面存在差异的两帧。
| Problem | What it looks like | Likely cause | Practical fix |
|---|---|---|---|
| Morphing | Product or face melts between states | Frames differ too much | Use more similar endpoints |
| Sudden cut | Video jumps to final frame | Transition is too difficult | Reduce pose/camera difference |
| Subject drift | Face, logo, or product changes | Identity constraints are weak | Match references more closely |
| Geometry changes | Buildings or objects stretch | Model must invent unseen surfaces | Simplify camera move |
| Wrong motion | Model reaches the end frame through odd action | Prompt does not define the path | Describe one physical action |
| Lighting flicker | Exposure changes unpredictably | Frame lighting conflicts | Match lighting or explicitly describe transition |
| End mismatch | Final generated frames only resemble target | Model treats endpoint as constraint, not guaranteed pixel copy | Leave room for an edit or use a stronger compatible model |
最重要的局限很简单:
提供的两帧约束的是转场,它们并不能保证每个物体在二者之间都保持完全一致。
目前哪些 AKOOL 模型的文档记录了起始帧与结束帧?
下表反映的是当前已发布的 AKOOL 文档,并不代表我在 10 月 1 日直接测试过你账户的实时界面。
| Model | Publicly documented start/end-frame support | What the documentation says |
|---|---|---|
| Kling 3.0 | Yes | AKOOL says its multi-reference controls include start/end frames for precise motion. Akool |
| Wan 2.7 | Yes | AKOOL explicitly lists Start and End Frame Control among its director-level controls. Akool |
| Kling 2.5 | Yes | AKOOL's published Kling 2.5 guide describes separate Start Frame and End Frame uploads. Akool |
| Veo 3.1 | Supported by the model provider | Google's current API supports first-and-last-frame interpolation. AKOOL also offers Veo 3.1, but confirm that your current AKOOL mode exposes the second-frame input before relying on it. Google AI for Developers |
AKOOL 更全面的模型对比还列出了 Kling 3.0 和 Kling 2.5 的起始/结束帧能力,并指出 Veo 3.1 在模型层面支持首帧/末帧。
不要想当然地认为同样的模式、时长、分辨率或输入组合在每个套餐或每个模型版本中都可用。

