新研究用因果干预定位LLM处理复数指代的注意力头,发现其偏好与人类一致
arXiv论文通过机制可解释性分析发现,LLM在预测代词回指时依赖一组负责表征、识别和传递复数指代信息的注意力头,且当实体本体相似并由“and”连接时更倾向用复数代词。
AI解读:这项研究要解决的是大模型在长文本中能否正确判断代词指代的对象是单数还是复数——这是指代消解的一个基础问题,比如看到“苹果和香蕉”时,模型需要知道后面的“它们”指的是这两个实体。研究者用机制可解释性和注意力模式分析,对模型内部进行因果干预,定位出一组注意力头分工负责三件事:存储输入中的指代信息、识别哪些实体构成复数指代、把信息传给最终选择先行词和预测代词的部分。对想改进模型推理能力或做可解释性研究的人,价值在于:这提供了一个可验证的神经机制路径,比单纯的端到端行为测试更能解释模型为什么做出某个判断。另一个发现是,当两个实体在本体上相似且用“and”连接时,模型和人类一样更倾向把它们看成一个复数整体来指代。不过,论文依据的是摘要,未说明具体模型、数据集规模和干预技术的细节,因此这些结论的适用范围还要看完整论文;对普通用户来说,这不会改变日常使用,除非你在开发依赖长文本理解的AI系统,那么可以关注这组注意力头的可迁移性。
9月3日提交至arXiv的一篇论文(编号2609.03687)通过机制可解释性和注意力模式分析,研究了大型语言模型(LLM)如何表征和检索单数与复数实体以完成复数指代。研究者使用因果干预技术,找出一组注意力头分别负责:在输入中表征指代信息、识别构成复数指代的实体、将信息传递给负责选择先行词和预测代词的部分。
论文还发现,LLM在复数代词偏好上与人类一致:当实体在本体上相似并且由连词“and”连接时,它们更可能被视为一个复数实体并被以复数形式指代。该论文由Anh Danh、Rick Nouwen和Massimo Poesio撰写,属于计算语言学(cs.CL)领域。