新基准CSM-MTBench评测20余款机器翻译模型处理中文社交媒体俚语与网络新词的能力

来自阿里巴巴等机构的研究者构建了一个覆盖五个中-外语言方向的中文社交媒体机器翻译基准,发现现有模型在语义保真与风格化表达保持上表现参差不齐。

AI解读:中文社交媒体的俚语、网络新词和风格化表达更新极快,传统机器翻译评测常忽略这类非正式文本,导致模型表现被高估。CSM-MTBench的出现,让开发者和研究者能针对性地检验模型在真实中文社交场景中的翻译质量:它把测试分为侧重俚语新词的Fun Posts和侧重语气风格保持的Social Snippets,并建议对后者用嵌入相似度和LLM作为裁判来打分,而不是依赖COMET这类传统指标。对20多个模型的实验显示,当前系统在语义保真和社交媒体特有风格线索上的处理差异很大,意味着如果你的产品或研究依赖中文社媒内容的翻译,现有模型未必可靠,需要在这个基准上重新筛选或微调。对普通用户而言,日常翻译软件的社媒内容可能仍存在失真,这不一定是马上需要行动的事,但对做跨境电商客服、社媒运营或NLP研究的团队,这个基准提供了一套可复现的评估与改进依据。

Kaiyan Zhao、Zheyong Xie、Zhongtao Miao、Xinze Lyu、Yao Hu、Shaosheng Cao(作者单位据摘要未明确)发布中文社交媒体机器翻译基准CSM-MTBench,论文被EMNLP 2026 Findings接收(arXiv:2601.22931v2,2026年9月3日更新)。

基准结构与评测方法

基准覆盖五个中-外语言方向,包含两个由专家精选的子集:Fun Posts(富含语境、俚语和网络新词的内容)和Social Snippets(强调简洁、情感和风格驱动的表达)。

针对不同子集,研究者提出定制化评测方法:对Fun Posts,测量俚语和网络新词的翻译成功率;对Social Snippets,采用嵌入指标与LLM-as-a-judge的混合方式评估语气和风格保持。

论文指出,高质量平行数据需要熟悉平台特定俚语的双语标注者,这导致数据稀缺;同时,COMET等传统评估器难以捕捉风格保真和非标准表达。

实验结果

对超过20个模型的实验显示,当前机器翻译系统在处理语义保真和社交媒体特定风格线索时表现出显著差异。

信息来源