研究团队发布PACE数据集与PaceMaker框架,提升个性化助手对用户隐性冲突请求的识别能力

韩国研究团队提出PACE基准与多智能体框架PaceMaker,用于评估和提升模型在个性化助手中识别隐性上下文冲突的能力。

AI解读:个性化助手(如手机语音助理)通常会直接执行用户的请求,但有些请求在具体情境下并不合适——例如用户已戒酒却要求推荐酒吧。以往的安全检测研究依赖显式提供的因素,而现实中这类冲突往往藏在用户个人知识库中,需要模型主动检索。PACE数据集专门测试模型能否发现这种隐性冲突,PaceMaker则用多个分工明确的智能体(查询改写、图谱遍历、冲突过滤)来找出决定性证据。实验显示PaceMaker在证据检索和冲突判断上都优于现有方法。对助手开发者来说,这项研究提供了可量化的评测基准和一套可复现的检索框架;对普通用户而言,短期内感受不到变化,但长期看助手“拒绝请求”的行为会更符合个人背景。局限在于PACE目前是研究数据集,其效果仍需在真实产品场景中验证。

韩国研究团队(Yoojin Kim、Jihyoung Jang、Hyounghun Kim)在arXiv发布论文,提出PACE(Personalized Assistants for Conflict Evaluation)数据集和多智能体框架PaceMaker,用于评估和提升模型识别个性化助手中隐性冲突请求的能力。论文标注为EMNLP 2026录用,全文59页,代码已公开(arXiv:2609.03293)。

PACE数据集与PaceMaker框架的核心内容

研究指出,个性化助手不仅应执行用户请求,还应结合用户当前处境判断请求是否合适,但以往工作多聚焦于请求执行的准确性,忽略了对上下文的考量与基于冲突的拒绝机制。

PACE数据集将基于明确人设的用户请求与自我中心知识库事实配对,要求模型整合上下文证据判断请求是否存在冲突。该设置属于隐式检索,阻碍了请求与冲突知识之间的直接关联,使现有模型难以定位相关的用户特定事实。

为应对这一挑战,研究提出PaceMaker多智能体框架,由专业智能体在查询改写、多跳图遍历和冲突感知过滤等环节协同工作,以检索具有决定性的上下文证据。实验对比了PACE上的证据检索质量和冲突判断准确率,显示PaceMaker一致优于现有方法。

  • PACE:新数据集,用于评估模型能否识别由自我中心知识或事件构成的隐性约束,这些约束使看似合理的用户请求变得不合适。
  • PaceMaker:多智能体框架,通过查询改写、多跳图遍历和冲突感知过滤的协作来检索决定性证据。
  • 实验结果表明,PaceMaker在证据检索和冲突判断上均优于现有方法。

信息来源