
用视频上下文延续场景
为 Gemini Omni 1.1 Flash 提供已有片段,并描述接下来要发生的动作,让角色、环境和故事方向获得连续的视觉参考。模型支持最长 10 秒的上下文场景扩展;带视频输入时,输出时长由模型决定。
Gemini Omni 1.1 Flash 是谷歌专为 AI 视频生成与编辑打造的多模态模型,为您提供更强的创作掌控力。支持长达 10 秒的上下文场景扩展、首尾帧控制、360p 视频快速草稿、视频参考,以及最高 4K 画质输出。
把文字构思、人物图片和视频参考组织成同一个创作方向。无论是让静态画面动起来、安排镜头的开场与结尾,还是延续已有场景,都可以围绕动作、光线与镜头语言逐步细化。

为 Gemini Omni 1.1 Flash 提供已有片段,并描述接下来要发生的动作,让角色、环境和故事方向获得连续的视觉参考。模型支持最长 10 秒的上下文场景扩展;带视频输入时,输出时长由模型决定。

用首帧确定人物、产品与环境的初始构图,再用尾帧表达希望到达的画面。结合动作和运镜描述,为产品转场、人物出场及循环动画提供更明确的视觉目标。

图片可以表达主体外观、服装、场景与风格,视频可以提供运动和镜头节奏。把每份素材的用途写进提示词,帮助 Gemini Omni 理解哪些特征需要保留、哪些动作需要重新演绎。

先用 360p 探索提示词、动作与镜头构思,再选择 720p、1080p 或 4K 生成所需画质。草稿适合比较方向,高画质适合进一步检查人物、材质与场景细节;重新生成时,画面细节可能发生变化。
| 片段时长 | 4 / 6 / 8 / 10s |
|---|---|
| 输出画质 | 360p / 720p / 1080p / 4K |
| 提示词上限 | 20,000 字符 |
| 参考素材 | 7 |
写清主体、动作、环境和运镜。有参考素材时,说明每张图片或每段视频用于控制什么。
从文字开始,或使用首尾帧、全能参考。选择画面比例和可用画质,在提交前确认预计积分。
在创作结果中查看任务进度与视频。根据动作、构图和细节调整提示词,再生成下一版。
从商品图开始,加入展示角度、光线变化和镜头移动,制作产品短片或竖屏社交内容。
为角色补充下一步动作,利用人物图片与已有镜头建立联系,逐段发展短片情节。
围绕推拉、跟拍或环绕运镜探索同一场景,用短片比较气氛、构图和叙事节奏。
说明谁在什么环境下做什么,再补充运镜和光线。短片中避免同时塞入太多互不相关的动作。
指定保持人物外观、服装或产品材质,同时写清需要改变的动作、镜头或环境。
先确定横屏或竖屏,再选择时长与画质。带视频参考的任务由模型决定输出时长。
了解创作方式、输出设置与积分计算。
它是谷歌面向视频生成与编辑的多模态模型,结合提示词、图片和视频参考来引导场景、人物及动态,支持首尾帧控制与最高 4K 输出。
可以。在首尾帧模式中不添加图片,直接描述镜头,再选择时长、画面比例与画质即可准备生成。
两种模式分别使用。需要指定开场与结尾时使用首尾帧,尾帧须搭配首帧;需要综合图片和视频信息时使用全能参考。
360p 适合先看构图和动作方向;720p、1080p 与 4K 用于不同清晰度需求。这里是选择生成画质,并不是把已有草稿一键无损转换为 4K。
没有视频参考时,可选择 4、6、8 或 10 秒。带视频输入时,输出时长由模型自动决定,手动选择的时长不再生效。
积分随模型、画质、时长、参考素材和任务数量变化。请以上方创作面板显示的预计消耗为准,提交前即可确认。