孟加拉语习语基准数据集发布:Phi-4-mini、Kimi-K2与Gemini-2.5-flash各擅胜场
研究者推出首个大规模孟加拉语习语基准数据集,测试大语言模型在释义、习语识别和意义理解三项任务中的表现,结果显示没有单一模型全面胜出。
AI解读:孟加拉语有超过3亿使用者,但属于低资源语言,大语言模型对其习语的理解一直缺乏系统评测。这项研究首次提供了大规模孟加拉语习语基准数据集,并配套一套合成选择题,把任务拆成释义、习语片段识别和意义理解三项,分别找到当前表现最好的模型——Phi-4-mini-instruct擅长释义,Kimi-K2-32b-instruct擅长找习语位置,Gemini-2.5-flash擅长解释含义。对开发者而言,这意味着做孟加拉语NLP应用时不能指望单一大模型包揽所有任务,应先明确最需要的功能再选型;同时,这个开源基准也让后续模型改进有了可对比的标尺。不过论文只是发布数据集和初步评测,没有给出具体准确率数字,也没有说明数据集规模、来源语域或测试题生成的具体方式,所以模型之间的差距有多大、实际使用效果如何,还需要看后续研究公开更多细节。
一篇发表于arXiv的论文(编号2609.03410)提出首个大规模孟加拉语习语基准数据集,并合成了一套用于习语意义识别的多项选择题集。研究者据此评测了近期多个大语言模型在释义、习语跨度检测和意义识别三项任务上的零样本与小样本表现,发现模型性能差异显著,没有任何单一模型在所有任务上持续领先。
论文作者来自孟加拉国达卡大学计算机科学与工程系,包括Mousumi Akter、Md. Faiyaz Abdullah Sayeedi、Nurul Labib Sayeedi与Swakkhar Shatabda。论文称,在解析任务方面Phi-4-mini-instruct表现最佳,跨度检测由Kimi-K2-32b-instruct领先,而意义识别由Gemini-2.5-flash胜出。