爱丁堡大学团队用程序合成给仿真轨迹“降维”,让大模型更可靠地推理物理系统
arXiv预印本提出用无监督程序合成把细粒度仿真轨迹翻译成稀疏的高层模式序列,再交给LLM处理,在物理基准上比原始轨迹更利于自然语言推理。
AI解读:大语言模型擅长语言任务,但面对具体物理系统(比如一个弹簧怎么拉伸、两个刚体怎么碰撞)时经常“想当然”,因为它们没有真正的物理直觉。这篇论文的思路是:不让模型直接读海量的仿真数据,而是先用程序合成的方法自动把那些细粒度的数值轨迹压缩成“刚性碰撞”“拉伸弹簧”这类高层模式序列,再把精简后的注释交给模型。这样做的好处是数据量小、模式清晰,模型更容易基于事实推理而不是猜。对研究者和工程师来说,如果这个方法被验证可靠,意味着可以用自然语言给物理仿真设定目标,系统能把目标自动转成奖励程序去求解,降低编写复杂奖励函数的门槛。但要注意,这还只是arXiv上的预印本,只经过物理基准测试验证,离真正稳定地用于机器人控制或工业仿真还有距离。普通用户不需要采取任何行动,等后续同行评审和开源代码再说。
爱丁堡大学的研究人员Sean Memery和Kartic Subr在arXiv预印本(编号 2602.10009,2026 年 9 月 3 日更新至v3)中提出,将物理仿真产生的轨迹先翻译成稀疏的“高层”结构模式,再交给大语言模型(LLM)处理,能显著提升模型对具体物理系统的推理能力。
论文指出,LLM目前无法可靠地推理特定物理系统;直接让模型查询物理模拟器并把原始仿真轨迹作为上下文,又因数据量大而扩展性差。作者提出的无监督学习方案通过程序合成生成一组“模式检测器”程序,把轨迹转成带注释的稀疏模式序列。
方法:无监督程序合成生成模式检测器
该方案的核心是用无监督学习训练一个程序库,其中的程序充当模式检测器,能把仿真轨迹映射为稀疏、带注释的模式序列。检测到的模式可选用人类专家提供的字符串标签(如“刚性碰撞”“拉伸弹簧”)来引导。
作者称,合成出的程序是透明、可解释的函数,能把系统状态映射到稀疏且高效的注释空间。依据论文摘要,这一翻译过程无需监督标签即可完成。
- 目的:解决LLM推理物理系统时因原始仿真数据过细、过多而难以扩展的问题。
- 手段:程序合成→模式检测器→把轨迹转成稀疏注释序列,专家可用字符串标签引导模式类型。
- 验证:使用近期物理基准,注释后表示更利于对特定物理系统进行自然语言推理。
示例应用:自然语言目标转奖励程序
作为示例,论文展示了物理系统中用自然语言指定的目标如何转换成奖励程序,并通过最大化这些程序来寻找解决方案。该论文仅以摘要形式公开(arXiv公告类型为replace),本报道基于摘要整理,未涉及未公开的具体实验细节和基准名称。