RuleMem:从历史对话归纳逻辑规则,提升长期对话问答准确率54.3%

在LoCoMo基准上,RuleMem以27.47分的绝对优势超越14个基线平均水平,相对提升54.3%。

AI解读:长期对话场景下,AI助手需要从大量历史对话中准确找信息和推理,但传统记忆机制把过往内容当作被动存储的事实,导致检索不精准、推理不可靠。这项研究提出RuleMem,核心做法是主动从历史对话中归纳出可复用的逻辑规则(自然语言Horn子句),再用规则去引导检索和回答,相当于给AI配了一张动态更新的规则清单。在LoCoMo基准测试中,RuleMem比14个基线平均准确率高出27.47个百分点,相对提升54.3%。对开发者而言,这意味着可以更放心地用长程记忆做客服或助手产品,但尚需关注其在不同模型和更复杂对话中的实际表现与部署成本。

arXiv计算语言学论文(arXiv:2609.03915)提出RuleMem,一个基于规则的记忆框架,通过从历史对话归纳可复用逻辑规则,主动引导证据检索与推理,在LoCoMo基准上达到最高准确率。

研究团队中山大学学者等人对比了14个基线模型,RuleMem以27.47分的绝对优势超过基线平均准确率,相对提升54.3%。

方法与机制

论文指出,现有长期对话记忆机制主要把过去信息作为被动存储的事实,导致语义鸿沟和推理不可靠。

RuleMem从对话构建自然语言Horn子句,并通过规则困惑度一致性(RPC)机制验证。归纳出的规则能检索语义上遥远但相关的证据,并为答案生成提供显式逻辑结构。

评估结果

论文在LoCoMo和LongMemEval_s* 两个长期对话基准上评估了RuleMem。在LoCoMo上与14个基线比较,RuleMem准确率最高,超过基线平均水平27.47个百分点(相对提升54.3%)。

论文未披露LongMemEval_s* 上的具体对比数据,也未提及模型规模、推理延迟等性能指标。

信息来源