泰米尔语拼写与语法纠错:渐进式微调序列到序列模型,mBART-50达 69.3% 准确率

arXiv论文提出四阶段渐进式微调方案,在最多 657,720 个合成句对上训练mT5-small和mBART-50,最佳模型mBART-50 v5在 1,000 句诊断集上取得 69.3% 的top-1精确匹配准确率。

AI解读:泰米尔语是一种黏着语,动词形态丰富,词边界存在复杂的sandhi(语音变化)规则,加上 247 个字母的书写系统,导致传统基于规则或n-gram的方法无法处理需要整句理解的上下文错误,如主谓一致和时态一致性。这篇论文提出用端到端序列到序列模型解决该问题:在最多 657,720 个合成噪声-干净句对上微调mT5-small和mBART-50,并将训练分为四个阶段,每个阶段针对不同错误类型。结果显示,渐进式训练是关键——加入上下文语法对后,主谓一致准确率从 1.0% 提升至 52.5%;加入跨词sandhi对后,sandhi准确率达到 87.5%。这对处理泰米尔语文本的NLP开发者意味着更可靠的纠错工具,但模型仍有局限:整体准确率 69.3% 意味着约 30% 的句子无法完全改正,且作者指出sandhi的召回提升以牺牲身份保留(如专有名词或数字)的准确率为代价。对于一般读者,无需立即行动,这只是学术预印本,尚未发布可直接使用的模型或代码。

研究人员提出一种用于泰米尔语拼写和语法纠错的端到端序列到序列方法,通过渐进式微调mT5-small和mBART-50,在 1,000 句平衡诊断集上实现 69.3% 的top-1精确匹配准确率。该论文由Karthikeyan A、Jaya Nirmala S、Sangeetha Sivanesan等人撰写,于 2026 年 9 月 3 日提交至arXiv(编号 2609.03273)。

问题与数据集

泰米尔语是一种黏着语,具有丰富的动词形态、复杂的sandhi(词边界的语音变化)规则,以及包含 247 个字母的书写系统。以往的工作主要针对词级表面错误,采用基于规则的方法、统计n-gram模型、最小编辑距离或混合流程,但这些方法无法可靠处理主谓一致、时态一致和跨词sandhi等需要整句理解的上下文错误。

研究团队采用端到端序列到序列架构,在最多 657,720 个合成噪声-干净泰米尔语句对上微调mT5-small和mBART-50,这些句对覆盖十类错误。训练采用四阶段渐进式日程,每个阶段针对一种弱点:表面噪声(v2)、上下文语法(v3)、单点sandhi(v4)和多点跨词sandhi(v5)。

结果与对比

评估使用 1,000 句平衡诊断集,该集合经核实与所有训练数据不重叠。最佳模型mBART-50 v5达到 69.3% 的top-1精确匹配准确率,其中sandhi错误准确率为 87.5%,主谓一致准确率为 43.5%。渐进式日程是关键:引入上下文句对后,主谓一致准确率从 1.0% 升至 52.5%;引入多点sandhi句对后,sandhi准确率从 0% 升至 87.5%。

论文还报告了文献中未见过的精确率-召回率权衡:sandhi召回率的提升会单调地以身份保留准确率为代价。此外,泰米尔语适配的指令模型Tamil-LLaMA-7B-Instruct在零样本设置下取得 19.0% 的准确率,三次示范后提升至 24.7%,而复制基线为 20.0%,表明该模型若无任务特定监督,无法迁移到专门的句子级纠错任务。

信息来源