光象科技与清华发布世界模型ActEffect:训练完即退出部署,机器人执行无需在线推理
世界模型不再随机器人上岗,留在训练阶段评估动作后果并优化策略。LIBERO平均成功率98.8%,LIBERO-PLUS为80.3%,RoboCasa-GR1为67.5%。
AI解读:这条新闻的核心变化是:世界模型不再是机器人执行任务时的“随身顾问”,而是留在训练阶段专门当“教练”。过去机器人每走一步,都要先让世界模型在脑内推演未来,推理链长、耗算力;光象科技和清华的方案是把这一层推演压缩到训练中,让模型反复检查机器人提出的动作会造成什么后果,把这种检查变成优化策略的反馈,训练完成后就把它从部署链路里摘掉。结果是机器人在执行时不再需要展开未来,直接走轻量链路,基准测试成绩却不降反升。对打算把具身智能搬进产线的企业,这意味着每台机器人每一步能省下一次未来展开的在线推理,几十上百个工位复制时,显卡、功耗和维护成本不会跟着推理长度一起涨。不过目前所有亮眼数字都来自仿真基准,真机上只有Phi-Bot X1在蔚来焊接场景连续运行21.5小时零失误的记录,且那是整套系统的成绩,ActEffect本身还没单独上产线,能力迁移和长期稳定性仍需验证。
光象科技联合清华大学李升波教授课题组于9月5日发布第一代物理原生世界模型Phi-WM 1.0 ActEffect。该模型只在训练阶段使用,评估机器人候选动作的后果并转化为策略优化反馈;训练完成后从部署链路退出,机器人执行时不再进行未来展开或候选动作搜索。
三版动作提案与受控世界模型
ActEffect以模仿学习为基础,让策略输出三份完整动作提案:前馈分支给出的“第一反应”、MIP动作头的粗提案、以及在粗提案上精修后的最终执行动作。三份提案都完整可执行,以便在相同起点比较后果。
受控世界模型接收当前视觉状态和一份动作提案,预测执行后的场景变化,三份动作各走一遍。语言指令留在VLA策略侧,受控世界模型不读取任务语言。未来状态被放进冻结的DINOv3视觉特征空间,不生成逼真图像,只捕捉物体位置、姿态和场景结构变化。
训练数据包含动作执行后的真实观测,模型将三次预测与真实未来比较,要求精提案比粗提案更接近、粗提案优于前馈提案。排序损失加了梯度截断,差答案不能靠变得更差来衬托好答案。训练完成后,受控世界模型和未来观测分支一起移除,只保留MIP动作头。
基准测试与消融实验成绩
在LIBERO基准上,ActEffect平均成功率98.8%,比DiT4DiT的98.6%高0.2个百分点。
在加入七类分布偏移的LIBERO-PLUS上,平均成功率80.3%,高于Fast-WAM的51.5%。
在RoboCasa-GR1的29维动作空间中,平均成功率67.5%,比第二名ABot-M0高9.2个百分点,比Fast-WAM高10.8个百分点。
消融实验显示:去掉后果反馈,LIBERO平均成功率从98.8%降至97.0%;把DINOv3特征空间换成VLM表示,成绩为97.3%;拿掉排序损失后降至98.1%。
部署逻辑与实际应用背景
光象科技称该方法针对工业部署成本:机器人执行时多做一次未来展开会增加算力和功耗,方案复制到多个工位时成本放大。ActEffect把“多想一会儿”留给训练,执行阶段保持轻量。
光象科技成立于2025年4月,由清华大学车辆与运载学院和人工智能学院联合孵化。创始人兼CEO张涛为清华大学博士、米兰理工大学博士后,曾任阿里巴巴高德地图技术总监和空间感知引擎负责人。联合创始人李升波长期从事自动驾驶与具身智能研究。
公司已围绕焊接上下料、移动质检等工位完成真实场景验证,并与多家国内外头部汽车企业展开商业合作。在2026 ATC展会上,Phi-Bot X1在蔚来汽车焊接上下料场景连续运行3天,累计作业21.5小时,零失误零中断。文章注明该纪录来自整套工业具身系统,ActEffect尚未单独接受真机验证。