苹果研究团队提出基于评分细则的奖励框架,提升开放域问答的事实性与连贯性
该框架依据检索证据生成查询特定评分细则,并在多个质量维度上提供细粒度监督,相比指令微调基线平均提升6.5%。
AI解读:苹果机器学习研究团队提出了一种新的奖励框架,用于改进开放域问答模型的训练。传统方法用单一评分衡量回答质量,难以兼顾事实性和表达连贯性等不同要求。新方法先根据检索到的证据为每个问题生成特定评分细则,再把这些细则拆分成多个质量维度(如内容组成、事实依据、指令遵循),让模型在训练中收到更细致的反馈。实验显示,这种方法在三个评估维度上平均比指令微调基线高6.5%,比不分维度的评分细则高4%。对于需要处理复杂开放域问答的研究或应用团队,这套框架提供了一种更可靠的训练信号,可能提升模型在事实支撑和逻辑组织上的表现。不过,该研究目前来自论文摘要,公开的详细数据和代码尚未披露,实际效果仍需完整论文和复现验证。
苹果机器学习研究团队发布论文,介绍一种基于评分细则(rubric)的奖励框架,用于开放域问答模型的后训练阶段。该框架依据检索到的证据为每个查询生成特定细则,并将其分解到多个质量维度,以提供细粒度监督信号。
研究显示,在组成(composition)、事实依据(grounding)和指令遵循(instruction-following)三个评估维度上,该方法相比指令微调基线平均提升6.5%,相比不分维度的扁平评分细则平均提升4%,且在所有评估数据集上表现一致。