研究质疑BLEU-4在手语翻译评估中的有效性,提出基于大语言模型的问答评测协议
一项预印本研究指出,BLEU-4分数提升未必代表手语理解能力增强,并提出一种更接近人类排序的开放权重大语言模型问答评测方法。
一项预印本研究质疑BLEU-4作为手语翻译(SLT)评估指标的有效性,称其分数提升不足以证明模型对手语的理解真的更好。研究者提出一种受语言学习评估启发的替代方案:用开放权重大语言模型进行问答评测,衡量译文是否保留关键内容。该协议与人类排序的一致性更高,对改写的容忍度是BLEU-4的六到七倍。
该论文由Oline Ranum、Edward Fish、Simon Hadfield和Richard Bowden撰写,于2026年9月3日提交至arXiv,编号为2609.03734。作者在摘要中承认,手语翻译的多模态、低资源环境可能让模型利用虚假相关性和口语先验,而不是学习更强的手语表示。
研究者评估了六个手语翻译模型在两个基准数据集(Phoenix-2014T和CSL-Daily)上的时空理解与BLEU-4分数之间的关系,结论是BLEU-4增益本身不能作为手语理解能力提升的证据。