
Gemini Omni 1.1 Flash 是什么?五大新功能、价格与中文上手教程(2026)
Google 刚刚发布的 Gemini Omni 1.1 Flash 深度解读:40 秒场景扩展、首尾帧转场、360p 草稿、4K 输出五大新功能,附价格渠道说明、API 上手教程和常见问题解答。
Gemini Omni 1.1 Flash 是 Google 于 2026 年 8 月 27 日刚刚发布的 AI 视频生成与编辑模型,核心升级是"可控生产":场景可以连续扩展到最长 40 秒、支持首尾帧转场、360p 草稿预览和 4K 成片输出。 开发者现在就可以在 Google AI Studio 里直接调用,订阅用户则可以在 Google Flow 和 Gemini App 中使用。
2026年9月1日更新:本文功能与价格信息已按 Google 8 月 28 日官方发布说明复核,API 教程可直接照做。
目录
- Gemini Omni 1.1 Flash 是什么?
- Gemini Omni 1.1 Flash 五大新功能
- Gemini Omni 1.1 Flash 价格与使用渠道
- Gemini Omni 1.1 Flash 上手教程:API 调用示例
- 和上一代 Gemini Omni Flash 有什么区别?
- 哪些产品已经在用?
- 常见问题 FAQ
Gemini Omni 1.1 Flash 是什么?
Gemini Omni 1.1 Flash 是 Google DeepMind「Gemini Omni」系列的最新版本,官方对它的定位是:一个可以从任何输入创建、编辑任何内容的多模态模型——目前的第一站是视频。
按照官方模型卡的信息,它的基本规格如下:
| 项目 | 说明 |
|---|---|
| 输入 | 文本、图片、音频、视频 |
| 输出 | 高分辨率、带音频的视频 |
| 架构 | Transformer,原生多模态支持 |
| 训练硬件 | Google TPU(JAX / ML Pathways) |
| 发布时间 | 2026 年 8 月 27 日(1.1 版本) |
和传统"文生视频"模型最大的区别在于:它同时理解画面、语音和对话指令,你可以像聊天一样对已生成的视频做编辑,比如"把主角换成图里这个角色,保持动作不变"。官方模型卡的原文是 "create and edit anything from any input, starting with video"。

Gemini Omni 1.1 Flash 五大新功能
这次 1.1 版本更新的重点不是"画质更高",而是让生成过程变得可控,官方称其为 "production-ready(可投入生产)"。五大新功能如下:
| 功能 | 说明 | 适合谁 |
|---|---|---|
| 场景扩展 | 最多参考前 10 秒画面上下文,按 10 秒一档续拍,累计最长 40 秒 | 需要讲连续故事的开发者 |
| 首尾帧插值 | 指定开头和结尾两个关键帧,自动生成中间连续画面 | 转场、环绕镜头、无缝循环素材 |
| 360p 草稿 | 低清快速预览,比 720p 快最多 60%,成本约三分之一 | 大量试错、分镜迭代的团队 |
| 4K 输出 | 草稿确认后可放大输出 1080p / 4K 成片 | 需要交付成品的创作者 |
| 视频引用 | 输入中可引用最多 3 秒参考视频,保持角色和动作一致 | 角色一致性要求高的场景 |
几个值得展开的细节:
- 场景扩展的记忆变长了。 上一代续拍视频时只参考"最后 1 秒"的画面,人物转个身就忘了前面的剧情;1.1 能分析最长 10 秒的前文,所以多轮续拍后画面和剧情依然连贯。API 层面通过
previous_interaction_id参数实现,把上一轮的交互 ID 传回去即可继续。 - 首尾帧插值解决的是"转场"这个老大难。 指定起止两帧后,模型会生成两帧之间的连续运镜,官方演示了甩镜转场、镜头推拉、360 度环绕等效果,全程无跳切(no jump cuts)。
- "先草稿、后放大"的工作流省钱又省时。 官方建议先用 360p 快速生成 3-4 版分镜草稿,选定方向后再放大到 4K,这也是官方示例应用 "Draft Room" 的核心思路。
Gemini Omni 1.1 Flash 价格与使用渠道
目前有四个使用渠道,按人群分开:
| 渠道 | 适合人群 | 说明 |
|---|---|---|
| Google AI Studio | 开发者(推荐入门) | 在线试用,也可通过 Gemini API 调用 gemini-omni-1.1-flash 模型 |
| Gemini Enterprise Agent Platform | 企业客户 | 通过 Agent Platform API 构建商用工作流 |
| Google Flow | 普通订阅用户 | 全球所有 Google AI Plus / Pro / Ultra 订阅者可用 |
| Gemini App | 普通订阅用户 | 场景扩展功能对订阅者开放 |
价格方面,官方给出了按分辨率的阶梯定价(见下图,具体单价以 官方定价表 为准):

对成本影响最大的是这条官方数据:360p 草稿的生成速度比 720p 快最多 60%,成本只有约三分之一。也就是说,"360p 试错 + 4K 交付"的组合,能把整个项目的生成成本压到过去的几分之一。
Gemini Omni 1.1 Flash 上手教程:API 调用示例
开发者在 Google AI Studio 拿到 API Key 后,用官方 Python SDK 就能调用。下面是官方博客给出的场景扩展示例:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=previous_video_interaction.id,
input=[
{"type": "text", "text": "Continue the scene."}
],
response_format={
"resolution": "360p",
},
)
三个关键参数:
model:固定为gemini-omni-1.1-flash;previous_interaction_id:传入上一轮生成的交互 ID,实现多轮续拍;response_format.resolution:草稿阶段用360p省钱,成品阶段改成更高分辨率。
提示词写法上,官方示例有三个值得模仿的习惯:
- 写清镜头运动:如 "camera slowly pulls out"(镜头缓慢拉远)、"dolly-zoom"(推拉变焦),而不是只描述画面内容;
- 强调连续性:在转场指令里明确写 "one continuous shot, no jump cuts"(一个连续镜头、无跳切);
- 标注声音氛围:如 "dramatic music score"(戏剧性配乐),因为模型输出本身就带音频。

和上一代 Gemini Omni Flash 有什么区别?
| 能力 | Gemini Omni Flash(2026 年 5 月) | Gemini Omni 1.1 Flash(2026 年 8 月) |
|---|---|---|
| 续拍上下文 | 仅参考最后 1 秒 | 最长 10 秒前文 |
| 最长视频 | 单次生成 | 累计 40 秒(10 秒一档续拍) |
| 分辨率控制 | 720p 为主 | 360p 草稿 + 1080p / 4K 成片 |
| 首尾帧插值 | 不支持 | 支持 |
| 视频引用 | 有限 | 最多 3 秒参考视频 |
| 定位 | 能力验证 | 官方明确"可投入生产" |
一句话总结:上一代证明了这个模型"能出片",1.1 让它"能进生产流水线"。
哪些产品已经在用?
官方博客披露的首批合作方已经覆盖主流创作工具:
- Adobe Firefly:已集成 Gemini Omni Flash 的视频编辑能力;
- Figma Weave:创意总监 Itay Schiff 评价其"扩展、参考素材和 4K 分辨率让团队从生成视频走向真正的导演工作";
- Runway:作为用户的另一种生成路径接入;
- GMI Cloud:指出其细节准确性让教育、解说类内容首次可以依赖 AI 视频。
如果你在做 AI 视频相关的技术选型,可以先看看我们之前的《AI 视频生成工具怎么选:任务类型、版权与验收清单》,把 Gemini Omni 1.1 Flash 放进选型清单里对比。动手能力强的开发者,也可以结合《Codex + Remotion 完整教程:用 AI 做视频》把生成素材直接接进程序化视频流水线。
延伸阅读
常见问题 FAQ
Gemini Omni 1.1 Flash 免费吗?
可以在 Google AI Studio 中试用;普通用户需要 Google AI Plus / Pro / Ultra 订阅才能在 Google Flow 和 Gemini App 中使用;开发者通过 API 调用按生成量计费,具体单价见官方定价表。
Gemini Omni 1.1 Flash 和 Veo 有什么区别?
Veo 是 Google 专门的电影级文生视频模型;Gemini Omni 系列的定位更宽,是"从任何输入创建和编辑任何内容"的多模态模型,视频只是它的第一个方向,强项在对话式编辑和多模态引用。
它最长能生成多长的视频?
单次生成后可通过场景扩展续拍,每次 10 秒,累计最长 40 秒。续拍时模型会参考最长 10 秒的前文来保持画面连贯。
支持中文提示词吗?
Gemini 系模型具备多语言理解能力,中文提示词可以使用;不过官方示例均为英文,涉及镜头语言和转场控制时,建议中英对照实测,关键指令用英文往往更稳定。
普通用户(不会写代码)怎么用?
订阅 Google AI Plus / Pro / Ultra 后,在 Google Flow 网页版即可直接生成和编辑视频,场景扩展功能也已在 Gemini App 中向订阅者开放,无需接触任何代码。
现在适合把它用到正式项目里吗?
官方已将其定位为"production-ready",且 Adobe、Figma、Runway 等已完成集成;但 AI 视频仍存在细节稳定性问题,建议正式项目采用"360p 草稿验证 + 人工审核 + 4K 成片"的流程控制风险。
Gemini Omni 1.1 Flash 和 Veo 是什么关系?
两者都做视频生成但定位不同:Omni 1.1 Flash 主打视频编辑与场景扩展(40 秒场景扩展、首尾帧转场),更像「视频剪辑助手」;Veo 主打从零生成完整视频。如果你的素材已有大半、只想补镜头或续场景,Omni 1.1 Flash 更合适。
总结
Gemini Omni 1.1 Flash 的核心价值是把 AI 视频生成从"抽卡碰运气"推进到"可控生产":更长的续拍记忆、精确的首尾帧控制、便宜的草稿流程和 4K 交付能力。对开发者来说,这是目前 Google 生态里最值得第一时间上手试用的视频模型——打开 Google AI Studio 就能开始。
最后更新于 2026 年 9 月 1 日。本文由 XIA345 运营团队撰写,我们长期跟踪 Google、OpenAI 等平台的模型更新,专注为中文开发者提供第一时间的一手信息解读与上手教程。模型发布后我们会持续补充实测数据与踩坑经验。
参考来源:Google 官方博客发布说明 · Google DeepMind 模型卡 · Google AI Studio
更多 AI 工具的使用指南,欢迎阅读《AI 创作入门:从想法到图片、文案与短视频方案》。

京ICP备2024094994号-29