Gemini Omni 1.1 Flash 是什么?五大新功能、价格与中文上手教程(2026)封面图
AI 创作约 8 分钟

Gemini Omni 1.1 Flash 是什么?五大新功能、价格与中文上手教程(2026)

AI 指南··0 浏览

Google 刚刚发布的 Gemini Omni 1.1 Flash 深度解读:40 秒场景扩展、首尾帧转场、360p 草稿、4K 输出五大新功能,附价格渠道说明、API 上手教程和常见问题解答。

Gemini Omni 1.1 Flash 是 Google 于 2026 年 8 月 27 日刚刚发布的 AI 视频生成与编辑模型,核心升级是"可控生产":场景可以连续扩展到最长 40 秒、支持首尾帧转场、360p 草稿预览和 4K 成片输出。 开发者现在就可以在 Google AI Studio 里直接调用,订阅用户则可以在 Google Flow 和 Gemini App 中使用。

2026年9月1日更新:本文功能与价格信息已按 Google 8 月 28 日官方发布说明复核,API 教程可直接照做。

目录

  • Gemini Omni 1.1 Flash 是什么?
  • Gemini Omni 1.1 Flash 五大新功能
  • Gemini Omni 1.1 Flash 价格与使用渠道
  • Gemini Omni 1.1 Flash 上手教程:API 调用示例
  • 和上一代 Gemini Omni Flash 有什么区别?
  • 哪些产品已经在用?
  • 常见问题 FAQ

Gemini Omni 1.1 Flash 是什么?

Gemini Omni 1.1 Flash 是 Google DeepMind「Gemini Omni」系列的最新版本,官方对它的定位是:一个可以从任何输入创建、编辑任何内容的多模态模型——目前的第一站是视频

按照官方模型卡的信息,它的基本规格如下:

项目 说明
输入 文本、图片、音频、视频
输出 高分辨率、带音频的视频
架构 Transformer,原生多模态支持
训练硬件 Google TPU(JAX / ML Pathways)
发布时间 2026 年 8 月 27 日(1.1 版本)

和传统"文生视频"模型最大的区别在于:它同时理解画面、语音和对话指令,你可以像聊天一样对已生成的视频做编辑,比如"把主角换成图里这个角色,保持动作不变"。官方模型卡的原文是 "create and edit anything from any input, starting with video"。

Google 官方博客宣布 Gemini Omni 1.1 Flash 发布

Gemini Omni 1.1 Flash 五大新功能

这次 1.1 版本更新的重点不是"画质更高",而是让生成过程变得可控,官方称其为 "production-ready(可投入生产)"。五大新功能如下:

功能 说明 适合谁
场景扩展 最多参考前 10 秒画面上下文,按 10 秒一档续拍,累计最长 40 秒 需要讲连续故事的开发者
首尾帧插值 指定开头和结尾两个关键帧,自动生成中间连续画面 转场、环绕镜头、无缝循环素材
360p 草稿 低清快速预览,比 720p 快最多 60%,成本约三分之一 大量试错、分镜迭代的团队
4K 输出 草稿确认后可放大输出 1080p / 4K 成片 需要交付成品的创作者
视频引用 输入中可引用最多 3 秒参考视频,保持角色和动作一致 角色一致性要求高的场景

几个值得展开的细节:

  1. 场景扩展的记忆变长了。 上一代续拍视频时只参考"最后 1 秒"的画面,人物转个身就忘了前面的剧情;1.1 能分析最长 10 秒的前文,所以多轮续拍后画面和剧情依然连贯。API 层面通过 previous_interaction_id 参数实现,把上一轮的交互 ID 传回去即可继续。
  2. 首尾帧插值解决的是"转场"这个老大难。 指定起止两帧后,模型会生成两帧之间的连续运镜,官方演示了甩镜转场、镜头推拉、360 度环绕等效果,全程无跳切(no jump cuts)。
  3. "先草稿、后放大"的工作流省钱又省时。 官方建议先用 360p 快速生成 3-4 版分镜草稿,选定方向后再放大到 4K,这也是官方示例应用 "Draft Room" 的核心思路。

Gemini Omni 1.1 Flash 价格与使用渠道

目前有四个使用渠道,按人群分开:

渠道 适合人群 说明
Google AI Studio 开发者(推荐入门) 在线试用,也可通过 Gemini API 调用 gemini-omni-1.1-flash 模型
Gemini Enterprise Agent Platform 企业客户 通过 Agent Platform API 构建商用工作流
Google Flow 普通订阅用户 全球所有 Google AI Plus / Pro / Ultra 订阅者可用
Gemini App 普通订阅用户 场景扩展功能对订阅者开放

价格方面,官方给出了按分辨率的阶梯定价(见下图,具体单价以 官方定价表 为准):

Gemini Omni 1.1 Flash 官方定价表,360p 与 720p 及 4K 输出价格对比

对成本影响最大的是这条官方数据:360p 草稿的生成速度比 720p 快最多 60%,成本只有约三分之一。也就是说,"360p 试错 + 4K 交付"的组合,能把整个项目的生成成本压到过去的几分之一。

Gemini Omni 1.1 Flash 上手教程:API 调用示例

开发者在 Google AI Studio 拿到 API Key 后,用官方 Python SDK 就能调用。下面是官方博客给出的场景扩展示例:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id,
    input=[
        {"type": "text", "text": "Continue the scene."}
    ],
    response_format={
        "resolution": "360p",
    },
)

三个关键参数:

  • model:固定为 gemini-omni-1.1-flash
  • previous_interaction_id:传入上一轮生成的交互 ID,实现多轮续拍;
  • response_format.resolution:草稿阶段用 360p 省钱,成品阶段改成更高分辨率。

提示词写法上,官方示例有三个值得模仿的习惯:

  1. 写清镜头运动:如 "camera slowly pulls out"(镜头缓慢拉远)、"dolly-zoom"(推拉变焦),而不是只描述画面内容;
  2. 强调连续性:在转场指令里明确写 "one continuous shot, no jump cuts"(一个连续镜头、无跳切);
  3. 标注声音氛围:如 "dramatic music score"(戏剧性配乐),因为模型输出本身就带音频。

DeepMind 官方 Gemini Omni Flash 模型卡页面

和上一代 Gemini Omni Flash 有什么区别?

能力 Gemini Omni Flash(2026 年 5 月) Gemini Omni 1.1 Flash(2026 年 8 月)
续拍上下文 仅参考最后 1 秒 最长 10 秒前文
最长视频 单次生成 累计 40 秒(10 秒一档续拍)
分辨率控制 720p 为主 360p 草稿 + 1080p / 4K 成片
首尾帧插值 不支持 支持
视频引用 有限 最多 3 秒参考视频
定位 能力验证 官方明确"可投入生产"

一句话总结:上一代证明了这个模型"能出片",1.1 让它"能进生产流水线"。

哪些产品已经在用?

官方博客披露的首批合作方已经覆盖主流创作工具:

  • Adobe Firefly:已集成 Gemini Omni Flash 的视频编辑能力;
  • Figma Weave:创意总监 Itay Schiff 评价其"扩展、参考素材和 4K 分辨率让团队从生成视频走向真正的导演工作";
  • Runway:作为用户的另一种生成路径接入;
  • GMI Cloud:指出其细节准确性让教育、解说类内容首次可以依赖 AI 视频。

如果你在做 AI 视频相关的技术选型,可以先看看我们之前的《AI 视频生成工具怎么选:任务类型、版权与验收清单》,把 Gemini Omni 1.1 Flash 放进选型清单里对比。动手能力强的开发者,也可以结合《Codex + Remotion 完整教程:用 AI 做视频》把生成素材直接接进程序化视频流水线。

延伸阅读

常见问题 FAQ

Gemini Omni 1.1 Flash 免费吗?

可以在 Google AI Studio 中试用;普通用户需要 Google AI Plus / Pro / Ultra 订阅才能在 Google Flow 和 Gemini App 中使用;开发者通过 API 调用按生成量计费,具体单价见官方定价表。

Gemini Omni 1.1 Flash 和 Veo 有什么区别?

Veo 是 Google 专门的电影级文生视频模型;Gemini Omni 系列的定位更宽,是"从任何输入创建和编辑任何内容"的多模态模型,视频只是它的第一个方向,强项在对话式编辑和多模态引用。

它最长能生成多长的视频?

单次生成后可通过场景扩展续拍,每次 10 秒,累计最长 40 秒。续拍时模型会参考最长 10 秒的前文来保持画面连贯。

支持中文提示词吗?

Gemini 系模型具备多语言理解能力,中文提示词可以使用;不过官方示例均为英文,涉及镜头语言和转场控制时,建议中英对照实测,关键指令用英文往往更稳定。

普通用户(不会写代码)怎么用?

订阅 Google AI Plus / Pro / Ultra 后,在 Google Flow 网页版即可直接生成和编辑视频,场景扩展功能也已在 Gemini App 中向订阅者开放,无需接触任何代码。

现在适合把它用到正式项目里吗?

官方已将其定位为"production-ready",且 Adobe、Figma、Runway 等已完成集成;但 AI 视频仍存在细节稳定性问题,建议正式项目采用"360p 草稿验证 + 人工审核 + 4K 成片"的流程控制风险。

Gemini Omni 1.1 Flash 和 Veo 是什么关系?

两者都做视频生成但定位不同:Omni 1.1 Flash 主打视频编辑与场景扩展(40 秒场景扩展、首尾帧转场),更像「视频剪辑助手」;Veo 主打从零生成完整视频。如果你的素材已有大半、只想补镜头或续场景,Omni 1.1 Flash 更合适。

总结

Gemini Omni 1.1 Flash 的核心价值是把 AI 视频生成从"抽卡碰运气"推进到"可控生产":更长的续拍记忆、精确的首尾帧控制、便宜的草稿流程和 4K 交付能力。对开发者来说,这是目前 Google 生态里最值得第一时间上手试用的视频模型——打开 Google AI Studio 就能开始。


最后更新于 2026 年 9 月 1 日。本文由 XIA345 运营团队撰写,我们长期跟踪 Google、OpenAI 等平台的模型更新,专注为中文开发者提供第一时间的一手信息解读与上手教程。模型发布后我们会持续补充实测数据与踩坑经验。

参考来源Google 官方博客发布说明 · Google DeepMind 模型卡 · Google AI Studio

更多 AI 工具的使用指南,欢迎阅读《AI 创作入门:从想法到图片、文案与短视频方案》。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-29

© 2026 AI345 · All Rights Reserved

用户服务协议·隐私政策