EDIT框架:用内部信号定位推理错误,训练更遵循评分标准的LLM评分器

arXiv论文提出两阶段训练方法EDIT,在真实多学科评分基准上超越强基线,并在规则编辑干预下展现最高规则响应度。

AI解读:这篇论文解决的是大语言模型(LLM)按评分标准(rubric)批改学生答案时的一个核心问题:模型可能给出正确分数,但推理过程并未真正依据评分细则和答案中的证据,导致分数难以解释、也容易被规则改动误导。研究者提出EDIT框架,分两步训练:先让模型用内部信号(对最终分数的后验信念、对输入依据的依赖程度)定位出错的具体推理步骤,再结合评分清单局部修改;随后用基于信念的奖励塑形微调,既惩罚会大幅带偏分数的错误探索,又保留有益的尝试空间。在真实多学科评分基准上,EDIT在领域内和跨领域测试中都稳定超过强监督学习和强化学习基线,消融实验确认效果来自内部状态诊断。普通读者不必立刻关心此新闻——它影响的是用AI辅助阅卷的系统开发者,而非被评分的学生;对相关工程师和管理者,值得评估EDIT的信念校准设计能否移植到自己的评分流程。目前公开信息只有摘要,尚未提供模型大小、数据规模或与具体商业阅卷系统的对比,因此所有结论都限定在论文宣称的实验范围内。

6 月 4 日提交、9 月 2 日更新的arXiv论文(编号 2606.06350v2)提出Evidence-Diagnosed Intervention Training(EDIT),一个两阶段训练框架,用于让LLM评分器更严格地依据评分标准给出评判。

论文作者来自多家机构,包括Zhihao Wu、Linhai Zhang、Taiyi Wang、Runcong Zhao、Peter Andrews、Cesare Aloisi和Yulan He,归稿于计算语言学方向,摘要页标注DOI为 10.48550/arXiv.2606.06350。

EDIT方法:内部信号定位错误步骤

根据摘要,EDIT分两阶段工作。第一阶段EDIT-SFT用两类内部模型信号——对最终分数的后验信念,以及输入依据分数(input-grounding scores)——定位推理中出问题的步骤,并只借助评分清单(rubric checklist)修改这些局部步骤,而不是重写整个推理链。

第二阶段EDIT-RL用信念引导的奖励塑形来校准评分器:奖惩设置惩罚那些会造成大幅有害信念漂移的行为,同时保留有益的探索空间。作者称现有针对数学推理等自包含任务的信用分配和干预方法,难以识别评分推理出错的位置,也无法捕捉模型在推理过程中对最终分数的信念变化,因此不适用于评分场景。

  • 研究中用户评分场景的具体意图和限制:用户需要在评分过程中追踪分数合理性。本方法不是要在所有场景中取代人,而是辅助有监督的LLM评分器在依据明确时可定位关键证据和标准条目。
  • 该方法定位的是内部推理步骤,不是外部标签。用户若想复核模型为何给出某分,需能访问模型中间信念和依据分数;若缺少这些内部信号的项目,则不适用。
  • 已知限制:对需要在生成全过程中持续保持信念一致的多步推理场景,仍依赖评分清单和模型的内部状态可用性。

实验设置与结果

研究者在两个真实、多学科评分基准上测试EDIT,比较对象为强监督微调和强化学习基线。摘要总结称,EDIT在领域内和跨领域(out-of-domain)划分上均持续优于这些基线,消融实验证实内部状态诊断带来了主要提升。

研究者还做了确定性评分规则编辑干预实验:即改变评分细则后观察评分器是否相应地改变判断。结果是EDIT-SFT是所有评估系统中规则响应度最高的,EDIT-RL在提升准确率的同时大体保留了这种响应性。

依据是论文摘要,未包含模型规模、基准具体学科、数据规模或分数差距的数值等信息,这些细节需以全文为准。

  • 关键限制条件:摘要中未见各基线的具体得分、模型大小和数据量,无法判断实际提升幅度是否具有实用意义。
  • 外部验证范围:所有关于“最规则响应”和“稳定超越”的表述都限定于论文实验设置,未覆盖其他未见学科或教材版本。

信息来源