研究:新一代视觉语言模型并非总能提升自动驾驶性能

LightEMMA框架在nuScenes基准上对 15 个模型进行纵向评估,发现模型规模扩大并未带来一致的驾驶性能提升。

AI解读:这项研究直接检验了业界一个默认假设:新一代视觉语言模型(VLM)一定比上一代更擅长自动驾驶。LightEMMA框架用统一协议测试了五个主流系列的 15 个模型,不针对具体模型做微调或提示优化,结果发现模型规模更大、通用推理更强,但驾驶性能并不总是跟着提升。对开发者而言,这意味着不能只靠堆参数或等下一代模型来改善自动驾驶,必须针对驾驶场景做专门适配——研究反复观察到模型过度依赖历史动作、难以处理冲突视觉信息等固定失败模式。普通用户暂时不需要为这一结论做任何改变;真正相关的是自动驾驶研发团队,他们应将评估重点从通用能力转向场景特定的安全测试,并优先解决这些反复出现的失败模式,而不是单纯等待更大参数的模型。

一项于 2025 年 5 月首次发布、2026 年 9 月更新的arXiv研究(编号arXiv:2505.00284)提出LightEMMA框架,该框架用于纵向评估视觉语言模型(VLM)的自动驾驶能力。研究在nuScenes预测基准上对隶属于五个主要系列的 15 个模型进行了测试,结果发现,尽管模型规模扩大、通用推理能力增强,但后续的VLM代际并未持续带来更优的驾驶性能。该研究由Zhijie Qiao、Haowei Li、Zhong Cao和Henry X. Liu完成,源代码已在GitHub上公开。

信息来源