EMNLP 2026论文提出StatefulDiscovery框架:让科学发现智能体在探索中避免过度解读
该框架通过外化调查状态,协调前沿选择、证据获取与主张判定,在40项真实数据任务中生成更多被判定为证据充分且高价值的主张。
AI解读:开放式的科学发现任务要求AI智能体自己决定下一步研究什么,但一个常见问题是‘过度解读’,即基于不充分的证据提出超出分析范围的主张。StatefulDiscovery的核心思路是把调查状态外化,让智能体在决定下一步行动时同时跟踪已有证据支持了什么、还能主张什么,把探索轨迹和主张状态绑定。这样做的直接效果是,智能体在面对未知现象时不再只追求产出更多结果,而是按证据强度判断‘现在能说什么’,从而减少自欺式的推测。论文在40项真实数据任务上的评估显示,相比基线方法,它能产出更多同时被判定为‘证据充分’且‘高价值’的主张。这对从事自动科学发现研究的开发者有用,它也给了普通人一个判断依据:当AI宣称有科学发现时,是否配备了这种证据校准机制,将决定其结论是否值得信任。需要指出的是,目前该工作还停留在论文验证阶段,没有披露用于真实科研决策的实际效果,其优势也仅来自论文作者提出的基准实验。
南方科技大学的研究者提出一个名为StatefulDiscovery的科学发现框架,旨在解决开放式科学发现中智能体可能过度解读证据、提出超出分析范围主张的问题。该论文已被EMNLP 2026 Findings接收,代码已发布在GitHub: https://github.com/SUSTech-GenAI/StatefulDiscovery.git。
研究问题与框架设计
论文指出,开放式科学发现要求智能体不止于为预设问题执行分析,而要在多轮探索中自行决定哪些现象值得调查。这带来一个证据校准问题:探索轨迹必须与主张状态耦合,让证据同时指导下一步调查内容和当前可作的主张。StatefulDiscovery的做法是外化调查状态,用它来协调前沿选择、证据获取和主张判定。
消融实验显示,结构化假设、局部判定、前沿控制和持久状态在框架中各自承担不同角色。作者总结称,显式的发现状态可以将探索与证据校准的主张形成过程耦合起来。
- 方法:StatefulDiscovery外化调查状态,并以此协调三个环节——前沿选择(决定下一步调查什么)、证据获取、主张判定。
- 评估:在 40 个真实数据发现任务上进行测试,与多个基线相比,方法生成了更多整体上被认为既有充分证据支持又具有高价值的主张。
- 消融:结构化假设、局部判定、前沿控制、持久状态各自发挥不同作用。