GPS-Bench:用立法记录、游说披露等实证数据检验LLM政策模拟的基准

新基准将政策与受影响主体、行动及下游影响关联,用人工标注作为金标准,比较多智能体推理、图方法与微调等不同预测方式。

AI解读:政策分析不只是预测提案能否通过,更要判断谁会受影响、这些主体如何回应、之后会发生什么。GPS-Bench把立法记录、游说披露、监管文件、公司申报和经济数据等公开证据,与政策涉及的主体、行为和下游影响绑定,让每个主体都成为带出处的证据对象,而不是凭空设定的角色。论文发现,在基于证据的单一政策状态下微调模型,对主体级影响的预测最强,把任务拆成多智能体并不比它更准;分解带来的主要是机制解释,而非更高的预测精度。对政策研究者或政府科技团队来说,这意味着如果要评估某项政策对不同群体的实际冲击,先整理并微调于证据记录可能是最可靠的路径,而多智能体模拟更适合用来理解复杂的互动成因,不应期待它自动提升预测分数。需要留意的是,该论文目前处于投稿阶段,结论尚未经同行评审,具体方法细节应以最终版本为准。

一篇于2026年9月提交至arXiv的论文(编号2609.03553)引入了GPS-Bench,一个用于治理政策模拟的证据基准。论文作者包括Linh Le、Melanie Bui、My Chiffon Nguyen、Zachary Schlosser和David Williams-King,目前论文处于投稿阶段,尚未经同行评审。

GPS-Bench通过立法记录、游说披露、监管文件、公司申报、经济数据及其他公开证据,将政策与相关主体、主体行为和下游影响关联起来。基准中的主体根据带日期记录重建,而非被提示为原型,因此每个主体档案都是带出处的证据对象。

评估设计与方法对比

人工标注池构成Gold评估集;由另一个LLM基于检索证据标注的案例作为Silver监督,绝不用作测试标签。所有推理模式都读取相同的实证状态并输出相同结构,使基准能将“多智能体模拟是否有帮助”转化为受控比较:在单一政策状态下,对比联合推理、独立与可通信的主体智能体、基于图的方法以及权重级微调。

论文摘要指出,在实证记录上微调得到的主体级影响预测最强,分解并未超越它;分解带来的主要是机制解释。主体持有私有的非完全相同的证据,每个主体看到自己的暴露条款,并与具名伙伴提出具体的联合提案,说明各自提供什么、需要什么回报以及为何合作优于单独行动,从而形成的联盟可与记录中的承诺对照。

  • 论文的发现基于arXiv摘要,而非全文阅读,具体实验细节与可复现性需以全文为准。
  • GPS-Bench旨在为研究证据、主体建模和多智能体交互何时能改善政策结果预测与解释提供共同实证环境。

信息来源