新研究:印地语与马拉雅拉姆语中,仅调整语序或语态便致多语言LLM数学推理显著退化

该研究构建了IndicReStruct基准,涵盖GSM8K-Reordered与GSM8K-Voice两个变体,在6个先进多语言LLM上验证了结构扰动对推理性能的一致影响。

AI解读:这条新闻揭示了一个关键问题:当前多语言大模型虽然表面上看能处理多种语言,但对句子的表面形式极其敏感。研究人员用印地语和马拉雅拉姆语做了实验,只是把句子里的成分顺序调换一下,或者把主动句改成被动句——这些操作不改变意思——结果模型的数学解题能力就明显下降。这说明模型并没有真正理解句子的含义,而是在依赖一些表面的句法线索。对开发者来说,这意味着在评估模型时不能只看标准测试集的表现,还要测试它在不同句式下的鲁棒性;对使用这些模型做本地化应用的人来说,同一个问题换个说法可能就会得到不同答案,影响服务质量。中断分析显示,问题常出在模型搞不清实体和数量之间的对应关系,而中间层的Transformer模块对恢复推理最有效,这给后续改进指了方向。目前这只是学术研究,还没有公开的修复方案,普通用户暂时无需特别行动。

印度与国际研究团队发布论文,报告多语言大语言模型(LLM)在语义保持的结构扰动下,数学推理性能出现显著且一致的下降。依据的是arXiv预印本论文《Lost in Reordering: Structural Sensitivity of Multilingual LLMs under Semantics-Preserving Perturbations》,已获EMNLP 2026 Findings长文录用。

基准与实验设置

研究针对印地语和马拉雅拉姆语(两者语序相对自由),设计了两种语言学扰动:有约束的句法成分重排,以及主动-被动语态转换。所有扰动均不改变原句语义。

团队据此构建基准数据集IndicReStruct,包括两个变体:GSM8K-Reordered与GSM8K-Voice,均由GSM8K题目改写而来,改写后保留了原意。

  • 对象语言:印地语(Hindi)和马拉雅拉姆语(Malayalam)
  • 扰动类型:受约束成分重排、主动-被动语态转换
  • 评测模型:6个当前最先进的多语言大模型;测试了多种提示策略
  • 结果发现:全部模型在结构扰动输入下,数学推理表现均出现一致且显著的下降

故障的定位与分析

研究团队开展了定性错误分析和对残差流激活的机制可解释性实验(residual-stream activation patching)。

分析显示,推理失败的常见成因是实体与数量之间的对齐关系被扰动打乱;

在中间层的Transformer模块对恢复推理的贡献最强。

论文总结为:当前多语言LLM对表层句法实现非常敏感,在结构不同但语义等价的输入下,缺乏稳健的成分不变性。

信息来源