新基准CulturalMenuBench揭示:多模态模型识别食物高分,却难将菜品归因中国地方菜系

研究团队构建含4870项、覆盖18个地区10种语言的CulturalMenuBench基准,测试12个模型发现,在标准选择题上超过94%的模型,在将菜品归因于中国地方菜系时准确率最高仅56%。

AI解读:多模态语言模型在食物识别测试中接近满分,但新发布的CulturalMenuBench基准表明,这种高分可能只是视觉匹配,而非真正的文化理解。研究测试了12个模型,发现它们在标准多选题上超过94%的准确率,在将菜品归因到中国地方菜系时却跌至至多56%,且错误模式与随机猜测一致。关键证据是:模型仅凭菜名分类菜系比看图片更准(高出7到18个百分点),说明知识已存在于模型中,但无法通过视觉输入激活。这项研究对模型开发者的直接启示是,训练需明确连接视觉感知、烹饪步骤和文化背景,否则识别能力再高也无法支撑跨文化的实际应用。对普通用户而言,不必急于行动,但可预期未来美食推荐或菜谱理解类AI在文化归属上仍可能出错,尤其在涉及地域菜系时需谨慎依赖。

多模态语言模型在食物识别基准上接近满分,但新研究指出,这一成功可能只反映视觉匹配,而非真正的文化理解。为检验这一区别,研究团队推出CulturalMenuBench基准,包含4,870个项目,覆盖10种语言、18个地区;其10项任务将成品菜与分步烹饪图像,同食材、步骤文本和地区标签配对,范围从基础识别到基于过程的文化归因。

研究者评估了12个模型,发现存在显著的知识应用差距:在标准多选题上超过94%准确率的模型,在将菜品归因于中国地方菜系时,最高准确率仅56%,尽管两者都采用相同的四选一格式。诊断分析显示,错误模式与随机猜测一致,准确率随视觉显著性而非文化结构变化,且模型仅凭菜名分类菜系的准确度比凭图像高出7至18个百分点。

基准设计与实验方法

CulturalMenuBench由Bo Zeng、Linfeng Gao、Peiqin Lin等研究者提出,论文收录于EMNLP 2026 Findings。代码和数据已公开。研究团队构建了4,870个项目,覆盖10种语言、18个地区,包含10项任务,将成品菜和分步烹饪图像与食材、步骤文本和地区标签配对。

一个消融实验确认这些任务确实需要过程证据:移除连续的烹饪图像,会有选择地降低依赖于过程的任务表现,而其他任务保持稳定。

信息来源