新流水线框架PiPMRE提升医学关系抽取,无需标注模式

PiPMRE通过语言模型将医学关系抽取转化为生成任务,在两个公开数据集上平均提升 5.6 个召回点、4.4 个准确率点,少样本场景下仍具优势。

一篇发表于arXiv的论文(编号 2609.02896)提出一种基于语言模型的流水线框架PiPMRE(Pipeline based on language model for Medical Relation Extraction),用于从医学文本中联合抽取实体及其关系。论文已收录于《Proceedings of the Annual Meeting of the Cognitive Science Society》Vol. 47 (2025)。

作者Jiaxin Duan、Fengyu Lu、Junfei Liu指出,以往研究将医学关系抽取视为序列标注任务,但医学实体间关系复杂,导致标注方案设计困难,或多重关系抽取失败。PiPMRE将该任务从语言学视角重构为生成任务:首先由关系生成器产出多个关系三元组,随后关系过滤器对每个三元组打分,仅保留达到临界的作为最终结果。

方法与性能

根据论文摘要,PiPMRE不需要标注模式,而是使用简单模板重构输入文本,以保证实体和关系按上下文顺序生成。

在两个公开数据集上的实验结果显示,PiPMRE比之前的最先进方法平均提升 5.6 个召回点和 4.4 个准确率点,并在少样本设置下表现更优。

  • 关系生成器生成多个关系三元组。
  • 关系过滤器对每个三元组打分并保留高于边界的作为最终结果。
  • 实验表明超半数场景占优,但具体数据集和评估细节有待完整论文。

信息来源