模型Google DeepMind·原文 2026年5月18日本站收录 2026年9月5日

谷歌推出Gemini Omni Flash:可对话编辑视频的多模态生成模型

该模型支持以视频、图像、文本、音频为输入生成高质量视频,并允许通过自然语言指令逐步修改场景、动作和风格。即日起面向Gemini付费用户及YouTube Shorts开放。

AI解读:谷歌把Gemini的多模态推理与内容生成能力结合,推出Gemini Omni Flash,首批能力聚焦视频生成与编辑。此前Nano Banana只能处理图像,而新模型接受视频、图像、文本、音频任意组合作为输入,输出连贯视频,并用自然语言对话完成编辑。对创作者来说,最直接的变化是:不用重新拍摄,口头描述就能改场景、加角色、换风格,且不同指令之间保持角色一致和物理连贯性。它利用Gemini的世界知识生成需要历史或科学背景的内容(如按字母找物品或解释蛋白质折叠),但默认输出仅限视频,且编辑语音内容仍需等待责任测试。该模型面向Google AI Plus/Pro/Ultra订阅者在Gemini应用和Google Flow中开放,YouTube Shorts和Create应用用户本周内可免费体验。需要提醒的是,所有生成视频附带不可见的SynthID水印,便于验证来源。

5 月 20 日(Google I/O 2026),谷歌DeepMind发布Gemini Omni系列首款模型Gemini Omni Flash,支持以图像、音频、视频和文本任意组合作为输入,生成基于Gemini世界知识的视频,并允许用户通过自然语言对话直接编辑视频。

模型即日起向全球所有Google AI Plus、Pro和Ultra订阅者开放,可通过Gemini应用和Google Flow使用;同时从本周起免费向YouTube Shorts和YouTube Create应用用户提供。开发者与企业API版本将在未来几周内推出。

Gemini Omni系列在推出初期仅支持视频输出;后续计划支持图像和音频输出。所有AI生成的视频均包含不可见的SynthID数字水印。

核心能力与应用前景

根据官方公告,Gemini Omni Flash可处理多模态输入,例如用户提供图像、文本、视频或音频作为参考,并输出连贯的视频。其编辑功能通过对话完成:每次指令会基于上一次结果逐步叠加,保持角色一致性与物理效果连贯。

系统在生成时结合了对重力、动能、流体动力学等物理现象的直觉理解,以及Gemini对历史、科学和文化背景的知识。官方示例包括让用户描述一个弹珠在轨道上的运动、生成按字母顺序排列物品的短片,或制作蛋白质折叠的黏土动画。

公司强调,与仅覆盖静态图像的Nano Banana模型相比,Omni系列更全面的多模态输入支持是一大升级。官方博客表明该模型是Gemini在原生多模态基础上的自然演进。

  • 能力 1:视频生成与编辑——用自然语言描述即可修改场景、动作、角度或风格,且保持物理一致性和上下文连贯。
  • 能力 2:世界知识驱动——利用Gemini的历史和科学知识生成符合现实逻辑的场景。
  • 能力 3:多模态输入——用户可组合图像、文本、视频和音频(初期音频仅支持语音参考)作为生成或编辑的依据。
  • 能力 4:数字头像——允许以个人数字头像生成视频(初始版本不包含音频编辑)。

责任与开放性

谷歌表示未来将逐步测试并评估通过对话改变视频中语音或文字的能力,以确保安全可控后再向用户开放。

所有生成内容都带有不可感知的SynthID数字水印,可在Gemini应用、Chrome或搜索中验证。

  • 开放范围:Google AI Plus/Pro/Ultra订阅者可全球使用(Gemini应用与Google Flow);YouTube Shorts与Create用户本周免费获取。
  • 限制:默认仅限视频输出;音频输入目前仅支持语音参考,其他音频输入类型稍后推出。
  • API:未来几周向开发者与企业开放。

信息来源

Google DeepMind原始来源