スタートフレームは AI 生成クリップの最初の画像を設定し、エンドフレームは意図した最終画像を定義します。動画モデルはその間の動きを生成します。結果はモデル、プロンプト、画像同士の相性、利用できるコントロールによって変わるため、2 枚のフレームを与えても、オブジェクトやキャラクターの完全な連続性が保証されるわけではありません。
AI 動画におけるスタートフレームとエンドフレームとは?
スタートフレームとエンドフレームは、ショットがどう始まり、おおよそどこで終わるべきかを AI 動画モデルに伝える 2 つの視覚的な基準点です。モデルはその後、これらの状態をつなぐために必要な中間の動きを生成します。
ワークフローは次のように考えてください。
スタートフレーム → 生成された動き → エンドフレーム
例:
- スタートフレーム:テーブルの上に置かれた、閉じた黒い製品の箱
- エンドフレーム:同じ箱が開き、製品が見えている状態
- プロンプト:箱とロゴを変えないまま、ふたが開くのに合わせてカメラをゆっくりと後方へ引く
モデルは単に 2 枚の画像をフェードでつないでいるのではありません。もっともらしい中間フレームの連なりを作り出そうとします。
Google は Veo 3.1 のドキュメントで、これを補間(interpolation)と呼んでいます。最初の画像が初期フレームとして、最後の画像が最終フレームの制約として与えられます。Google AI for Developers
これは、テキストでモデルに「開いた箱で終わらせて」と指示するのとは異なります。テキストは終わり方を説明できます。一方、本来のスタート/エンドフレームのワークフローでは、実際の最終画像そのものを与えます。
スタートフレームとエンドフレームは、画像から動画とどう違うのか?
画像から動画では通常、1 枚の画像でクリップの始まりを固定します。スタート/エンドフレーム生成では、トランジションの両端を固定します。
| Workflow | Required input | What you control | Main continuity advantage | Common failure |
|---|---|---|---|---|
| Single-image image-to-video | One image + prompt | Starting appearance and motion direction | Strong first-frame identity | Ending can drift |
| Start + end frames | Two images + prompt | Beginning, intended ending, and transition direction | Both compositions are visually constrained | Middle can morph unnaturally |
| Video extension | Existing clip + prompt | Continuation after the existing endpoint | Carries motion forward | New section may drift |
| Video Reference | Reference clip + target asset | Motion/camera/style behavior | Better motion guidance | Target may inherit unwanted reference behavior |
AKOOL の標準的な AI 動画ジェネレーターは、すでに複数のモデルファミリーで画像から動画に対応しています。重要なのは、選択した特定のモデルと現在のモードが 2 つ目のフレーム入力を備えているかどうかです。
「この構図で終わらせて」といったテキスト指示を、スタート/エンドフレーム制御と呼んではいけません。2 枚目の画像は、実際にフレームの制約として与えられなければなりません。
スムーズにトランジションする 2 枚のフレームをどう選ぶか?
スタート画像とエンド画像が、被写体の同一性、カメラ位置、構図、ライティング、アスペクト比の点で近いほど、モデルがその間で作り出さなければならない視覚情報は少なくなります。
とくに 5 つの要素が重要です。
被写体を一貫させる
1 枚目の画像が青いボトルを示し、2 枚目が少し異なるボトルの形を示している場合、モデルは製品が変形するのか、それともその不一致を無視すべきなのかを判断しなければなりません。
両方の画像で、同じキャラクター、製品、衣装、素材、重要なディテールを使ってください。
カメラアングルとフレーミングを合わせる
わずかなフレーミングの変化は、説得力のあるカメラの動きを示唆できます。
正面からのクローズアップから、やや引いた正面のショットへのトランジションは、比較的シンプルです。
正面からのクローズアップから俯瞰ショットへのトランジションでは、モデルは見えていない面を再構築し、はるかに大きなカメラ動線を作り出す必要があります。
ライティングに整合性を持たせる
昼から夜へのトランジションが可能なのは、まさにライティングが変化することを前提としているからです。
しかし、キャラクターのポーズ変化だけが目的の場合、無関係な大きなライティングの違いは、モデルが解決すべき問題を一つ増やしてしまいます。
同じアスペクト比を使う
可能な限り、両方の画像を同じ最終構図で作成してください。片方の端点を引き伸ばしたりトリミングしたりすると、フレーム内で被写体が現れる位置が変わってしまいます。
不可能なポーズ変化を避ける
人物がカメラに向かって座った状態から始まり、最終画像ではまったく別の部屋でカメラに背を向けて立っている場合、モデルは大量の動きと見えていない視覚的ディテールを作り出さなければなりません。
シンプルなトランジションのほうが、通常は同一性をよりよく保てます。
AKOOL でスタートからエンドフレームの動画を作成するには?
現在の AKOOL ワークフローでスタートフレームとエンドフレームの両方を備えているモデルを使ってください。AKOOL の公開ドキュメントには現在、Kling 3.0 と Wan 2.7 のスタート/エンドフレーム対応が記載されていますが、アカウントに実際に表示されるコントロールは、生成前に必ず確認してください。
AKOOL の現在の Kling 3.0 のページには、そのマルチリファレンスのワークフローが精密な動きのためにスタート/エンドフレームを使えると記載されています。
AKOOL の Wan 2.7 のページには、ショットの動きの弧を定義するためのスタート・エンドフレーム制御が別途記載されています。
実践的なワークフローは次のとおりです。
- AKOOL の AI 動画ジェネレーターを開きます。
- 現在スタート/エンドフレームの入力を備えているモデルを選択します。
- 1 枚目の画像をアップロードします。
- 意図した最終画像をエンドフレームの欄にアップロードします。
- 2 枚の画像がすでに示している内容ではなく、トランジションがどのように起きるべきかを記述するプロンプトを書きます。
- 出力のアスペクト比を両方の入力フレームに合わせます。
- 生成し、クリップの中間部分を始まりや終わりと同じくらい注意深く確認します。
2 枚の画像が端点を制約します。プロンプトはその経路を説明します。
選択したモデルが 2 フレームの入力を備えていない場合は、代わりに対応している画像から動画のモードを使ってください。終わり方をテキストで記述するだけで、この機能を擬似的に再現しようとしないでください。
より複雑なカメラやアクションのガイドについては、AKOOL の 動画リファレンスガイドで、既存のクリップが動きやスタイルをどう導けるかを説明しています。
スタートフレームとエンドフレームで有効なプロンプトのパターンは?
製品リビール
製品が特定の最終的なヒーロー構図にたどり着く必要がある場合は、スタート/エンドのペアを使います。
スタートフレーム:密封された製品の箱、クローズのフレーミング。
エンドフレーム:箱が開き、製品が中央に配置された状態。
Start on the supplied close-up of the sealed box. Move the camera back slowly as the lid opens. End at the supplied clean hero frame of the product. Keep the logo shape, package geometry, and product color stable. One continuous shot.
確認すべき点:ロゴ、ふたの蝶番、製品の寸法、そして内部が見えるようになる瞬間に注目します。
失敗時の修正:カメラの動きの量を減らし、ふたが 1 つのシンプルな連続動作で開くように指示します。
昼から夜へのトランジション
このパターンは、構図が固定されたまま環境条件が変化する場合に有効です。
スタートフレーム:日中の通り。
エンドフレーム:夜の同じ通り。
Transition gradually from the supplied daytime street frame to the matching night frame. Keep all buildings, road geometry, and camera position fixed while the sky darkens and window lights turn on gradually. No cuts.
確認すべき点:照明が変化する間、建物が動いてはいけません。
失敗時の修正:建築物を明示的に固定し、望まない空間的変化を引き起こす場合は、動く車や群衆を取り除きます。
カメラの動き
制御されたプッシュ、プル、または部分的な周回を示唆するために、対応する 2 つの構図を使います。
スタートフレーム:製品のミディアムショット。
エンドフレーム:より寄った、斜め 3/4 からの製品ビュー。
Move smoothly from the supplied medium composition to the final three-quarter close-up. Use a slow clockwise camera move at constant height. Keep product proportions, logo, materials, and background unchanged.
確認すべき点:トランジションは、製品のモーフィングではなくカメラの動きのように感じられるべきです。
失敗時の修正:2 つの元フレーム間のアングルの差を小さくします。
キャラクターのポーズ変化
小さなポーズ変化のほうが、大胆な体の変形よりも容易です。
スタートフレーム:腕を楽にして立っている人物。
エンドフレーム:同じ人物が胸の高さ付近でカップを持っている状態。
Keep the character's face, clothing, hairstyle, and body proportions unchanged. The right arm lifts naturally to pick up the cup and reaches the supplied final pose. Camera remains fixed. No change to lighting or background.
確認すべき点:指、腕の長さ、顔の同一性、カップの位置、衣服のしわ。
失敗時の修正:手の動作を単純にするか、指の細かな動きが少なくて済む、より大きな対象物を使います。
シーンの変化
スタート/エンドのペアは、様式化された環境の変化を導けますが、大きなシーンの変化はモーフィングのリスクが最も高くなります。
スタートフレーム:人のいない未来的な広場。
エンドフレーム:雪に覆われた同じ広場。
Keep the camera position, architecture, and plaza layout fixed. Snow gradually begins falling and accumulating until the scene matches the supplied winter frame. Buildings must not change shape. No cut or camera movement.
確認すべき点:表面が変化する間、建築物は固定されたままであるべきです。
失敗時の修正:ライティングや天候の変化を、建築物の変化から切り離します。環境とカメラの両方を同時に変化させるようモデルに求めるのは避けてください。
スタートフレームとエンドフレームで何がうまくいかなくなるのか?
端点が正しくても、生成された中間部分が破綻することがあります。ほとんどの問題は、あまりに多くの点で異なるフレームを両立させるようモデルに求めることから生じます。
| Problem | What it looks like | Likely cause | Practical fix |
|---|---|---|---|
| Morphing | Product or face melts between states | Frames differ too much | Use more similar endpoints |
| Sudden cut | Video jumps to final frame | Transition is too difficult | Reduce pose/camera difference |
| Subject drift | Face, logo, or product changes | Identity constraints are weak | Match references more closely |
| Geometry changes | Buildings or objects stretch | Model must invent unseen surfaces | Simplify camera move |
| Wrong motion | Model reaches the end frame through odd action | Prompt does not define the path | Describe one physical action |
| Lighting flicker | Exposure changes unpredictably | Frame lighting conflicts | Match lighting or explicitly describe transition |
| End mismatch | Final generated frames only resemble target | Model treats endpoint as constraint, not guaranteed pixel copy | Leave room for an edit or use a stronger compatible model |
最も重要な制約はシンプルです。
与えた 2 枚のフレームはトランジションを制約します。しかし、その間ですべてのオブジェクトが完全に同一であり続けることを保証するものではありません。
現在、どの AKOOL モデルがスタートフレームとエンドフレームを記載しているか?
以下の表は現在公開されている AKOOL のドキュメントを反映したものであり、10 月 1 日にあなたのアカウントの実際の UI を直接テストしたという主張ではありません。
| Model | Publicly documented start/end-frame support | What the documentation says |
|---|---|---|
| Kling 3.0 | Yes | AKOOL says its multi-reference controls include start/end frames for precise motion. Akool |
| Wan 2.7 | Yes | AKOOL explicitly lists Start and End Frame Control among its director-level controls. Akool |
| Kling 2.5 | Yes | AKOOL's published Kling 2.5 guide describes separate Start Frame and End Frame uploads. Akool |
| Veo 3.1 | Supported by the model provider | Google's current API supports first-and-last-frame interpolation. AKOOL also offers Veo 3.1, but confirm that your current AKOOL mode exposes the second-frame input before relying on it. Google AI for Developers |
AKOOL のより広範なモデル比較では、Kling 3.0 と Kling 2.5 のスタート/エンドフレーム機能も挙げられており、モデルレベルでの Veo 3.1 のファースト/ラストフレーム対応についても触れられています。
すべてのプランやモデルのリビジョンで、同じモード、長さ、解像度、入力の組み合わせが利用できると思い込まないでください。

