模型量子位·原文 2026年9月7日

智象未来发布具身世界模型HiDream-O1-Embodied,首次参评即在RoboColiseum扰动适应榜单登顶

模型在RoboColiseum核心子榜Robustness中以平均分0.692登顶,覆盖多元指令、多视角协同与高容错训练。

AI解读:具身智能机器人此前在实验室里表现好,一到真实环境就容易“失灵”——光照变化、画面污损、视角偏移都会导致任务失败。智象未来这次发布的HiDream-O1-Embodied,专门应对这类非理想条件。它能理解多种说法表达同一个指令,比如“把杯子拿过来”和“给我拿个杯子”都会被识别为同一意图;同时结合多个摄像头视角,一处画面被遮挡时仍能靠其他角度继续执行任务。在训练中,模型主动引入光照突变、镜头抖动等干扰数据,而不是只练“完美画面”。这些设计在公开评测平台RoboColiseum的扰动适应子榜上得到验证:0.692的平均分位列第一,任务包括78个高保真仿真场景。对开发机器人的厂商或研究者来说,这意味着在执行抓取、导航等任务时,机器人的稳定性有了可量化的提升,模型在意外条件下的处理能力不再只是宣传话术。不过,榜单成绩来自仿真环境,真实部署中的表现仍需实测;此外,官方未披露何时开放商用或API。

2026年9月7日,智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied。据公司介绍,该模型旨在强化机器人的物理感知与动态预判能力,支持更高阶的物理交互。

RoboColiseum首测成绩

发布同期,模型首次参加具身智能模型评测平台RoboColiseum,在Robustness(扰动适应)子榜单中以平均分0.692登顶。RoboColiseum是高保真仿真评测平台,围绕指令跟随、空间理解、扰动适应与通用操作四个维度设置78个任务,面向全球研究机构开放。扰动适应被平台认为是最具挑战性的子榜,测试涉及改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写。

技术设计:语言理解、视觉感知与容错机制

智象称,模型在语言理解上突破了关键词匹配,覆盖多元动词、句式与表达方式的等价指令空间,能识别“把杯子拿过来”和“给我拿个杯子”为同一意图。视觉感知上,模型综合多个视角的信息,单一视角被遮挡或偏差时仍可借助其他视角理解场景并继续执行。高容错机制方面,训练阶段主动引入光照变化、画面污损、视野遮挡、信号波动等非理想条件,使模型能在不完整信息中作出判断。

数据生产范式与模型矩阵

智象采取“模型+数据”双驱动策略,提出“真实基座+生成增强”的数据生产范式。以与诺亦腾的合作为例,高精度真人动作捕捉数据作为真实底座,智象利用原生全模态能力进行百倍级数据扩增,在恪守物理约束的前提下切换背景、光照、物体形态生成变体视频。智象CTO姚霆表示,模型从设计之初便计划面向包括动作在内的全模态构建统一表征。约一个月前,智象发布了交互式世界模型HiDream-O1-World,并在WBench的Navi分榜以平均分80.9登顶。智象表示,交互式世界模型对应理解与推演,HiDream-O1-Embodied对应操作与执行。智象创始人兼CEO梅涛此前称,下一代大模型竞争的关键是从单模态走向原生统一的全模态。

信息来源

量子位原始来源