AI News字数 2699阅读时长7 分钟

Google 发布 Gemini Omni 1.1 Flash,支持 40 秒场景延展和 4K 升采样

Gemini Omni 1.1 Flash 新增更长的场景延展、关键帧控制、更快的 360p 草稿、视频参考和 4K 升采样。

文章目录 · 12
  1. 一、场景延展现可使用 10 秒上下文
  2. 二、关键帧和参考素材提供更直接的导演控制
  3. 三、从草稿到交付的分辨率工作流程
  4. 四、可用性以及从预览版到稳定 API 的转变
  5. 五、实际优势和已记录的限制
  6. 常见问题
  7. API 模型名称是什么?
  8. Gemini Omni 1.1 Flash 能否在一次请求中生成 40 秒视频?
  9. 该模型会生成原生 4K 视频吗?
  10. 它能延展任何上传视频吗?
  11. Gemini Omni 1.1 Flash 在哪里可用?
  12. 参考来源

Google 已发布 Gemini Omni 1.1 Flash,这是其多模态视频生成和编辑模型的面向生产环境更新。核心升级是场景延展:与 Google 之前的模型只能查看前面 1 秒的画面相比,该模型在生成续接内容时最多可分析此前 10 秒的素材。

开发者可每次将视频延展 10 秒,累计长度最长可达 40 秒。Google 表示,更大的参考窗口有助于模型在连续延展过程中保持角色、动作、光照、音频和叙事上下文的一致性,从而解决制作长于单个生成镜头的序列时面临的一个实际障碍。

稳定版 API 模型标识为 gemini-omni-1.1-flash。它接受文本、图像和视频输入,并生成带音频的视频。Google 的模型列表规定,输出时长为 3 至 10 秒,分辨率可选 360p、720p、1080p 或 4K,帧率为每秒 24 帧。

一、场景延展现可使用 10 秒上下文

场景延展会在现有片段的末尾生成新画面。Gemini Omni 1.1 Flash 可以延展此前在 API 交互中生成的视频,也可以延展通过 Google Files API 提供的上传视频。

对于模型生成的视频,开发者可通过 previous_interaction_id 传入此前交互的标识符。这样可保留前一次生成的状态,无需再次上传生成的视频。随后,开发者可以使用自然语言请求续接内容,包括对镜头运动、对白、音乐或场景下一部分事件的指示。

上传的片段也可以通过提示词进行延展,但 API 文档设定了更严格的条件。上传输入不得超过 10 秒,且模型只能在末尾追加画面。它无法在开头前置新的内容,也无法在片段中间插入延展内容。

对白规则也取决于工作流程。Gemini Omni 1.1 Flash 在通过多轮交互延展其自身此前输出时,可以生成额外的口语对白。目前,它无法延展其中已有说话者的上传视频并添加更多对白,不过仍可生成无声的续接内容。

在欧洲经济区、瑞士和英国,无法通过 API 编辑或延展上传的视频。模型生成视频的延展功能在可用地区仍受支持。

这些限制之所以重要,是因为 Google 所说的 40 秒指的是累计的多步骤延展,而不是一次生成 40 秒视频。每次续接仍会生成为较短的片段,前一段视频作为下一段的上下文。

二、关键帧和参考素材提供更直接的导演控制

Gemini Omni 1.1 Flash 新增首尾帧插值功能。开发者可以提供两张分别代表镜头开头和结尾的图像,然后描述所需的过渡效果。模型会将中间的动作生成为一段连续视频。

这一机制让创作者比仅使用文本提示词拥有更多控制力。起点和终点可以约束构图及主体位置,而提示词则指定镜头或场景应如何在两者之间移动。Google 将环绕运镜、变焦转场、甩镜和循环片段列为预期用途。

该模型也接受短视频参考。Google 表示,一段参考视频最多可向新场景贡献 3 秒的动作、视觉上下文或角色信息。API 文档指出,视频参考中的音频会被忽略,因此该功能应被理解为视觉和动作参考,而不是音频迁移系统。

这些控制功能是对原始 Gemini Omni 方法的扩展,而非替代。首个 Omni Flash 版本已支持对话式编辑:每次自然语言修订都可以基于上一次输出,同时尝试保留用户未要求更改的场景部分。1.1 版本为镜头边界、续接和由参考素材驱动的动作增加了更明确的约束。

有状态编辑仍取决于是否存储交互记录。如果开发者禁用存储,生成的视频之后便无法通过其 previous_interaction_id 进行编辑。大型输出也需要采用不同处理方式:Google 建议对于超过 4 MB 的视频文件使用 URI 传递,而不是内联返回整个文件。

三、从草稿到交付的分辨率工作流程

Google 将 360p 生成为草稿模式。该公司表示,根据系统吞吐量对比,360p 预览的生成速度可比标准 720p 输出快最多 60%,成本则为三分之一。

这项性能说明具体比较的是 360p 与 720p 的生成。它并非笼统宣称每个 Omni 1.1 请求都会比之前的模型快 60%。

这一低分辨率选项适用于在选定最终片段前测试多个提示词、镜头或构图变体的工作流程。应用程序可以生成低成本预览、对其进行比较,并将更高分辨率的处理留给选中的结果。

默认 API 分辨率为 720p。开发者可以请求 1080p 或 4K 输出,但 Google 的文档将两种格式均标为升采样输出。因此,文档并未说明该模型直接生成原生 4K 帧;它生成的是升采样后的交付版本。

这一差异与制作团队评估精细细节有关。4K 文件提供了更高分辨率的交付文件,但这一标签本身并不能证明其细节保留效果与原生 4K 分辨率生成或拍摄的素材相同。

四、可用性以及从预览版到稳定 API 的转变

Google 于 2026 年 8 月 27 日发布了 gemini-omni-1.1-flash,作为该模型稳定且全面可用的版本。此前的 gemini-omni-flash-preview 标识仍列为预览版本,而 Google 的弃用页面表示,尚未公布稳定模型的停用日期。

开发者可通过 Google AI Studio 中的 Gemini API 使用 Omni 1.1。企业客户可通过 Gemini Enterprise Agent Platform 基于该模型进行构建。对于此前不愿将预览版标识整合进长期维护产品的公司而言,这一发布状态具有重要意义:稳定模型名称现已提供明确的生产目标,尽管 Google 尚未公布停用日期。

Gemini Omni 1.1 Flash 也已在全球范围内向 Google AI Plus、Pro 和 Ultra 订阅者通过 Google Flow 提供。场景延展功能面向这三个层级的订阅者在 Gemini 应用中提供。Google 的公告并未说明每项新的 API 控制是否都以相同方式在各个消费者界面中开放。

现有集成将该模型的覆盖范围扩展至 Google 自有工具之外。Google 表示,Gemini Omni Flash 已集成至 Adobe Firefly,而 Figma Weave 和 Runway 也属于使用该模型的创意平台。这些集成是公司报告的示例,而非独立的性能评估。

五、实际优势和已记录的限制

对于创意工具开发者而言,此次发布通过一个模型提供了传统视频工作流程的多个阶段:低分辨率创意构思、端点受控的镜头生成、对话式修订、场景续接和高分辨率交付。因此,API 可以支持迭代式界面,让用户从此前生成结果分支,而不是通过新的提示词重新开始制作每一个镜头。

10 秒的延展上下文可能减少明显的不连续性,但并不能保证完全消除。Google 的模型卡指出,跨编辑的完整一致性、包含复杂动作的场景以及完全准确的文本仍然具有挑战性。因此,对连续性改善的主张应被视为相对于此前 1 秒上下文窗口的改进,而不是对每个序列都能获得无缝结果的承诺。

该 API 也不支持语音编辑或上传音频参考。它限制编辑包含某些可识别人物的图像,并且对于包含未成年人的图像,在欧洲经济区、瑞士和英国还适用额外限制。

对于在 Gemini 应用、Google Flow 或 YouTube 内生成或编辑的内容,Google 表示会应用不可感知的 SynthID 水印和 C2PA 内容凭证。Google 已发布的声明具体点名了这些产品,不应将其解读为确认通过 Gemini API 直接返回的每一段视频都会获得相同的来源标记处理。

常见问题

API 模型名称是什么?

稳定模型标识为 gemini-omni-1.1-flash。Google 还将 gemini-omni-flash-preview 列为预览版本。

Gemini Omni 1.1 Flash 能否在一次请求中生成 40 秒视频?

Google 描述的是每次 10 秒、累计最长 40 秒的延展。标准输出片段仍为 3 至 10 秒。

该模型会生成原生 4K 视频吗?

Google 的 API 文档将 1080p 和 4K 描述为升采样输出。默认生成分辨率为 720p。

它能延展任何上传视频吗?

不能。上传视频必须为 10 秒或更短,延展仅限于片段末尾,并且还适用地区和对白限制。

Gemini Omni 1.1 Flash 在哪里可用?

它可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 使用。Google AI Plus、Pro 和 Ultra 订阅者也可通过 Google Flow 使用它,Gemini 应用中则提供场景延展功能。

参考来源

Share

分享这篇文章