苹果发布REFACTOR-VLA:用“睡眠/清醒”两阶段架构教机器人学习可复用技能
该系统使用行为等价核函数聚类运动程序片段,并在LIBERO基准测试中展示了技能聚类质量的提升;同时发现增大世界模型规模反而会降低性能。
AI解读:苹果的研究团队提出REFACTOR-VLA,目的是解决现有视觉-语言-动作(VLA)模型难以完成长序列任务的问题。这类模型(如OpenVLA、π0等)直接输出原始动作,不会把任务拆解成可复用的技能模块,导致在多步骤任务中表现不佳。REFACTOR-VLA采用“睡眠/清醒”两阶段架构:睡眠阶段用行为等价核函数(BEK)基于世界模型的推演结果来聚类动作片段,清醒阶段再从聚类结果中生成类型化的lambda表达式作为技能,并由解码器用这些技能生成动作。在LIBERO基准测试中,系统通过辅助对比学习(InfoNCE损失)将技能聚类的归一化互信息(NMI)提升到0.46至0.92之间,表明聚类质量较高。另一项发现是,仅将世界模型从1.88亿参数增加到4.3亿参数,会导致所有四个基准套件的性能下降,说明规模并非关键。这项研究对机器人开发者意味着:未来可以更高效地将大模型嵌入实体机器人,并利用技能库提升任务的长期执行能力,但现阶段系统尚未达到可直接投入实际生产的状态。普通用户无需立即关注,技术团队可参考其方法改进自己的VLA模型。
苹果机器学习研究团队发布了REFACTOR-VLA,一个旨在让视觉-语言-动作(VLA)模型学习可复用技能的系统。该系统采用“wake/sleep”架构:在睡眠阶段,通过行为等价核函数(BEK)对运动程序片段进行聚类;BEK基于在潜在世界模型Mφ中执行动作的结果来判断。在清醒阶段,系统生成类型化的lambda表达式(基于Hindley–Milner类型系统的启发),随后由库条件整流流动作解码器将其转化为行为。
训练过程与基准测试发现
系统使用三阶段训练计划:阶段A为世界模型暖启动,训练潜在世界模型Mφ;阶段B为清醒阶段策略优化,优化使用技能库的策略;阶段C为睡眠阶段技能发现,将动作片段聚类为可复用技能。
研究团队在完整LIBERO基准套件上进行了评估。结果显示两个主要发现:首先,将世界模型规模从1.88亿参数增加到4.3亿参数,反而在所有4个基准套件上性能下降,这与“模型更大通常更好”的假设相悖。其次,在阶段A的世界模型暖启动中加入辅助监督对比损失(InfoNCE损失),显著提升了阶段C的技能聚类质量。聚类质量通过归一化互信息(NMI)度量,在多次随机种子下结果如下:物体套件(Object suite)为0.462 ± 0.021,空间套件(Spatial suite)为0.867 ± 0.025,目标套件(Goal suite)为0.915 ± 0.013,LIBERO-10套件为0.754 ± 0.010。