FrameBench:一个基于框架语义的英语和日语语言理解基准,测试LLM区分上下文动词框架的能力

该基准使用多项选择题来测试模型是否能区分同一动词在不同语境下所唤起的语义框架,涉及英语和日语,并通过本地母语者的判断构建。

AI解读:大语言模型在各类下游任务上表现很强,但它们能否像人一样,在理解句子时自动补全未明说的背景信息,此前没有直接的评测工具。FrameBench用框架语义学(frame semantics)设计了多项选择题:同一个动词在不同语境中会唤起不同的语义框架,模型必须要识别出这种区别才算答对。研究者在英语和日语上用FrameNet风格的资源,加上“生成—验证”流程和母语者判断,为多种模型做了实验,结果显示小型模型普遍吃力,而几个大型模型的分数超过了人类参考线。这个数据集和构建/评测代码已经在GitHub上(SasanoLab/FrameBench)放出,意味着任何研究团队都可以拿它去测自家的模型,衡量模型是否具备这种隐含的语义补充能力,而不只是看它在普通任务上的得分。需要留意的是,论文结论基于论文摘要,目前只覆盖英日两种语言,且人类参考分数是论文中给出的指标,不代表所有人类水平。

来自的研究者(Chihiro Yano, Ryohei Sasano)在一篇被EMNLP Findings 2026接收的论文中,提出了一个基于框架语义学(frame semantics)的多项选择基准FrameBench,用来评估大语言模型能否区分同一动词在不同语境中唤起的语义框架。该基准覆盖英语和日语,基于FrameNet风格的资源和生成—验证流程,并经过了母语者判断。

研究在多种模型上进行的实验显示,小型模型在该任务上遇到困难,而几个大型模型的得分超过了人类参考分数。

信息来源