谷歌发布Gemini Omni 1.1 Flash:视频生成新增场景扩展、首尾帧控制等专业功能

谷歌推出Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧指定、360p预览加速、4K放大和视频参考等生成式视频控制功能,通过Gemini API和Google AI Studio提供。

AI解读:这次更新把生成式视频从单纯“生成一段”推进到“精细控制每一段”的阶段,专业创作者的痛点由此直接对应解决方案:过去你只能让模型生成一个片段,现在可以基于已有视频继续扩展10秒,最长累计40秒,讲更长的故事;可以指定首尾帧让模型补出平滑的镜头运动;可以先生成360p草稿快速迭代,速度提升最多60%、成本降到720p的三分之一;最后还能把成片放大至4K。对广告、影视预演和内容工作室来说,这意味着工作流从“碰运气生成”变成“按分镜稿可控生产”。但要注意三点:场景扩展需要‘previous_interaction_id’保持上下文,单步只能加10秒;360p加速仅限草稿,成片仍需高分辨率输出;Omni 1.1 Flash目前面向开发者开放,普通Google AI付费订阅用户在Flow和Gemini应用中只能使用部分功能——其中场景扩展在Gemini应用中可用,但完整控制套件仍需通过API或AI Studio。

谷歌于2026年8月27日发布Gemini Omni 1.1 Flash,这是一套面向开发者的生成式视频与创意控制工具。据Google AI官方博客,该版本通过Gemini API和Google AI Studio提供,为专业用途设计,新增功能包括场景扩展到4K放大等。谷歌DeepMind产品经理Anish Nangia和Alisa Fortin在博客中表示,这些更新让生成式视频更可控、迭代更快,适合实际部署。

场景扩展:基于最长10秒前文延续视频

Omni 1.1 Flash允许开发者从现有视频末尾继续生成内容,实现无缝衔接。模型现在能分析最多10秒的先前上下文,而此前模型只参考最后1秒。该功能支持以10秒为增量扩展视频,累计总长度最长40秒,旨在提升视觉一致性和叙事连贯性。博客提供了一段Python API示例,其中调用`gemini-omni-1.1-flash`模型,通过`previous_interaction_id`参数引用前一个视频交互,并以文本指令‘Continue the scene.’驱动。

首尾帧控制与视频参考

开发者可以指定一段镜头的起始帧和结束帧,模型会在这两个关键帧之间生成连续视频,适用于复杂相机环绕、缩放过渡或无缝循环片段。博客列举了两个示例提示,均强调‘one continuous shot, no jump cuts’。此外,多模态输入现在支持引用最长3秒的视频,以维持视觉上下文和角色一致性。博客给出的示例涉及上传三个舞蹈视频和一组角色图片,要求模型让指定角色分别表演对应舞蹈,并最终形成单一连续的镜头。

预览与放大:360p草稿提速降本,最高支持4K输出

Omni 1.1 Flash支持生成360p分辨率的轻量预览,谷歌称其生成速度比标准720p分辨率最多快60%*,成本为三分之一。这一功能用于快速原型制作、故事板迭代和开发者平台内的渲染。博客注明,加速基于360p与720p的系统吞吐量对比(注释a)。对于成片,模型可输出1080p或4K分辨率,谷歌称其“适合专业制作”。“放大至4K”能力被官方列为新特性之一。

产品可用性

Omni 1.1 Flash现已通过Gemini API在Google AI Studio提供,企业用户可通过Gemini Enterprise Agent Platform API使用。博客还指出,从即日起,该模型面向全球Google AI Plus、Pro和Ultra订阅用户在Google Flow中开放;场景扩展功能在Gemini应用中同样对全球Google AI Plus、Pro和Ultra订阅用户开放。博客提及有客户已通过Agent Platform API将Gemini Omni Flash投入生产,但未给出具体客户名称或案例细节。

查看原图 · 1600 × 900
查看原图 · 2200 × 1237
查看原图 · 2000 × 580
查看原图 · 1200 × 348

信息来源