模型Google DeepMind·2026年9月3日

Gemini新增智能体式视频理解

Google将这项能力加入最新Gemini模型,目标是在减少token用量和成本的同时提高视频分析准确性。

AI解读:如果业务需要在视频中查找特定事件或整理内容,多步分析的用途在于围绕问题收集线索,再组合答案,而不是只给一段笼统描述。Google提出减少token和成本的目标,对有大量视频要处理的团队尤其相关,但目标不等于已验证的账单收益。当前摘要没有可比较的基准和价格,选型时更有价值的是看它对自己视频里关键片段的漏检情况,以及完成同一任务的实际费用。

Google表示,最新Gemini模型开始支持智能体式视频理解。与一次性回答视频问题不同,这种方式让模型围绕任务组织多个分析步骤,再综合视频中的信息给出结果。

Google把准确性提升、token用量下降和成本降低列为主要目标。当前Feed没有提供具体基准、价格和地区范围,因此这些效果仍以官方后续技术说明为准。

信息来源

Google DeepMind原始来源