研究Apple Machine Learning Research·原文 2026年8月20日本站收录 2026年9月5日

苹果提出LINK方法:用双语词典替换预训练词汇,提升低资源语言模型知识迁移效率

该数据级干预方法无需额外模型训练,仅需双语词典,在八种语言上最高可将达到同等性能的训练速度提升2倍。

AI解读:低资源语言的大模型表现差,根源是训练数据太少,模型学不到足够的世界知识和推理能力。过去想解决这个问题,得靠大量平行语料、翻译系统或额外训练,这些对多数语言都不现实。苹果研究者提出的LINK方法绕开了这些重装备:它只在预训练阶段把英语语料里随机选中的词替换成目标语言的翻译,靠双语词典就能做,成本几乎为零。这个操作等于在模型预训练时就给它塞进跨语言信号,让模型在学到英语知识的同时能直接关联到目标语言。在八种语言、五种模型规模的测试里,下游任务表现明显提升,达到同等效果的训练速度最高能快一倍。对做多语言模型团队来说,这是不用改架构、不用加数据就能用上的技巧;对普通用户而言,更直接的影响可能是未来手机输入法、语音助手对小语种的识别会变得更准,但现在论文还只是预印本阶段,效果尚未经过同行评审,实际大规模落地仍需验证。

苹果机器学习研究团队发布论文,提出一种名为LINK的数据级干预方法,通过在预训练阶段将高资源语言(英语)语料中的随机词汇替换为其词级翻译,来改善低资源语言模型的知识迁移。该方法不需要额外的模型训练、平行语料或翻译系统,仅依赖一个双语词典。研究者在八种语言和五种模型规模上进行了评估,结果显示目标语言的下游任务表现有显著提升,达到同等性能所需的训练时间最多可缩短至原来的二分之一(即2倍加速)。

方法原理与评估结果

论文指出,跨语言知识迁移对训练数据不足的语言构建高性能多语言模型至关重要。当目标语言数据稀缺时,科学推理、常识推断和世界知识等下游任务所需的知识主要需从高资源语言获取。现有改善迁移的方法依赖大量平行数据、翻译系统、辅助模型或额外训练阶段,这些对许多语言难以获得。

LINK方法的具体做法是:在预训练期间,从高资源(英语)训练语料的一部分中,按给定替换比例随机选取单词,替换为其词级翻译。整个过程无需额外模型训练,只需要一个双语词典,该词典几乎可以以接近零成本为任意语言获得。

论文作者包括Anastasiia Sedova、Natalie Schluter、Skyler Seto和Maartje ter Hoeve。需要说明的是,本报道依据的是论文摘要及公开内容,未包含完整论文的详细实验设置、具体语言列表和基准测试结果。

信息来源