研究团队发布首个亚美尼亚语开源大模型及完整训练数据

基于Gemma-4-E4B继续预训练,模型在开放亚美尼亚语模型中表现最佳;团队同时公开 437 万篇新闻语料与 37.3 万道数理题翻译数据。

AI解读:亚美尼亚语属于资源稀缺语言,此前没有任何一个开源大模型同时公开训练数据和完整配方,研究者想复现或改进都很困难。这篇论文的独特价值在于:团队不仅基于Gemma-4-E4B继续预训练得到arm-gemma-e4b模型,还完整公开了数据、模型和代码,使后来者可以直接在其基础上复现和继续研究。对做低资源语言NLP的研究者来说,ArmWeb(437 万篇新闻)和ArmSTEM(37.3 万道英阿并行数理题)本身就构成可复用的新语料。论文还指出一个容易被忽视的陷阱:最大的公开亚美尼亚语语料库与网页来源的评测集高度重叠,甚至FineWeb-2内部存在训练/测试自重叠,这意味着此前一些评测分数可能虚高。普通读者无需行动,这项成果主要面向低资源语言模型的研究和工程人员;真正相关的人可以下载模型和数据,在评测时注意避开与训练语料重叠的测试集。

来自多所机构的亚美尼亚语研究者发布arm-gemma-e4b,称其为第一个附带完整训练数据和配方的开源亚美尼亚语大语言模型。该模型通过对Gemma-4-E4B的继续预训练得到,在已知的开放亚美尼亚语模型中表现最佳,同时也优于未适配的基础模型。

开源语料与模型细节

  • ArmWeb:经过大规模验证的语料库,包含 437 万篇亚美尼亚语新闻文档。
  • ArmSTEM:包含 37.3 万道数学和科学问题的英阿平行数据集,含逐步解答,翻译后通过保留答案的大模型判定和人工评估双重验证。
  • arm-gemma-e4b基于上述数据继续预训练,论文未披露训练时长与算力配置。
  • 所有数据、模型和代码均已开放,论文为 18 页,含 4 张图和 13 张表。

训练发现与数据集风险提示

  • 消融实验显示,仅使用新闻数据进行继续预训练能提升语言流畅度,但会侵蚀知识;加入小比例经过验证的翻译STEM数据可逆转这一损失。同时,研究者在现有亚美尼亚语模型中观察到同样的模式。
  • 研究者发现,最大的公开亚美尼亚语语料库与基于网页的评测集之间存在严重重叠,包括FineWeb-2内部出现的训练集/测试集自重叠。这提示以往部分模型评测结果可能因数据泄漏而偏高。

信息来源