亚马逊科学家提出四种方法,为实体环境中的AI代理提供物理grounding
亚马逊科学家提出四种方法,将AI代理与其运行的物理现实进行grounding,以应对在仓库等高危环境中出现的幻觉问题。
AI解读:AI代理正从聊天机器人转向在仓库、工厂等物理环境中执行多步骤任务的实体,但模型幻觉在虚拟场景只是编造信息,放到物理系统里可能让机器人规划出不遵守动量、质量守恒的路径,危及人员或设备。亚马逊科学家的方案是把外部信息——物理定律、数值模拟、领域数据——嵌入模型推理,具体四条路:用物理第一性原理做预训练(PGDL)、校准不确定度让模型在该说“不知道”时停下(UQ4CT)、用模拟器补齐语言到数值的鸿沟(AWL)、用外部验证器循环检查输出是否违反科学或数学规则(Zephyrus和Hilbert)。这些方法可单独或组合用,效果数据偏向科研基准:UQ4CT降低25%以上的期望校准误差,AWL在物理科学数据集上准确率提升29%,Hilbert比最佳公开prover模型提升422%。对运营管理者而言,这意味着像亚马逊Project Eluna这类云端助手在给出瓶颈预判和行动建议前,会更可能踩住物理和安全红线;但研究仍是论文层面的框架与演示,Amazon Science没有给出在生产环境上线后误报率、部署成本等实测数据,落地效果还得看后续集成。技术决策者可以按场景挑方法:数据少就用PGDL,安全阈值敏感的操作用UQ4CT做闸门,数学证明需求看Hilbert;普通读者暂时不需要为这些模型改变日常操作。
亚马逊科学家提出四种方法,将人工智能代理与其运行的物理现实进行“grounding”,旨在应对在仓库等高风险环境中出现的幻觉问题。这些方法源自作者在加州大学圣迭戈分校及亚马逊Fulfillment Technology (AFT) 团队的研究,并已用于亚马逊的Project Eluna,这是一个协助履约中心运营经理的云端代理模型。
作者将“grounding”定义为整合外部信息(包括领域特定数据集、物理原理和数值模拟)来为模型的推理提供背景。四种方法可单独或组合使用。
四种支柱方法及性能数据
第一种是物理引导深度学习(PGDL),将旋转等对称性和微分方程等第一性原理嵌入预训练中,使预测遵循物理定律,并可能减少所需数据量。
第二种是不确定性感知推理,使用UQ4CT框架,通过混合专家方法将模型划分为专注的子网络,校准置信度与正确性。该框架在五个基准上保持高精度,并将期望校准误差(ECE)降低超过25%,即使在分布偏移下也能保持良好的泛化能力。
第三种是弥合文本到数值的鸿沟,通过适应-学习(AWL)框架,该框架结合世界知识蒸馏和动态工具适应来调用数值模拟器。相对于原始模型,AWL后训练的模型在答案准确率上提高了29%,模拟器工具使用率提高了12%,在物理科学数据集上的表现甚至超过了GPT-4o和Claude-3.5等最先进模型。
第四种是验证器增强的grounding,使用外部软件(如Zephyrus用于天气科学、Hilbert用于数学推理)来检查逻辑和现实性。Hilbert通过将复杂问题分解为子目标并使用形式验证器递归验证,其性能比最佳公开可用的prover LLM提升了422%。
未来方向
作者认为这四个支柱为将LLM锚定在现实中奠定了基础,并指出未来研究可以专注于用更复杂的多保真模拟进行微调、将不确定性作为探索的内在奖励信号,以及在规划阶段将物理定律作为形式验证器。
作者强调,这些技术成熟后将协同工作,物理引导学习结合校准的不确定性和形式验证,将比单一支柱更健壮,这对AI代理在物理世界中安全可靠的大规模扩展至关重要。