新评估协议FLY-EVAL++:飞行预测大模型安全性测试更严格

研究发现,在飞行轨迹预测等安全关键领域,仅靠准确率评估大语言模型并不足够,需结合物理可行性与安全约束验证。

AI解读:在飞行轨迹预测这类安全攸关的场景里,大语言模型(LLM)即使输出结果数值上接近真实值,也可能违反安全约束或物理规律——比如速度与高度组合不切实际。FLY-EVAL++正是针对这一盲区设计的评估协议,它除了看预测准不准,还要验证输出是否符合协议、物理上是否可行、是否触碰安全底线,再用固定评分标准汇总成可理解的多维度分数。研究团队用PilotBench的扩展版测试了66个大模型,发现安全合规是最能区分模型好坏的一项:预测性能相近的模型,安全分数可以相差超过28分,而且普遍存在物理状态看似合理但暗含安全违规的问题。这说明在安全关键领域,光看准确率是远远不够的。对开发飞行安全相关AI系统、或依赖这类预测做决策的机构而言,这套协议提供了一种更贴近实际风险的评价方式,能在部署前更早暴露模型的隐患。

一项新研究提出了名为FLY-EVAL++的评估协议,用于评测大语言模型(LLM)在安全关键、受物理规律约束环境中的表现。该研究作为会议论文发表在COLM 2026(Conference on Language Modeling),其预印本arXiv:2609.04021于2026年9月3日提交。

为何需要新评估方式

研究指出,在安全攸关的物理驱动环境中,仅基于准确率的评估指标不足以评判LLM。因为即便模型做出的预测在数值上与真实结果接近,仍可能违反运行约束,或在物理上产生不一致的场合并,或无法输出可用的结构化结果。

FLY-EVAL++方法与发现

FLY-EVAL++将协议合规性、物理可行性和安全约束的确定性验证,与固定评分标准引导的聚合相结合,生成可解释的多维度得分。研究者在扩展PilotBench设置后,将其具体应用于飞行轨迹与姿态预测(Flight Trajectory and Attitude Prediction, FTAP),新增了基于历史条件和多步预测的任务。

在对66个大语言模型(LLM)的测试中,安全合规性成为区分模型行为最具判别力的维度。结果显示,预测性能相近的模型,其安全得分可能相差超过28分。研究还观察到一些反复出现的失败模式,包括在物理上看似合理的预测中出现安全违规,以及多步展开时的不稳定性。

研究者据此认为,在安全关键领域进行评测时,应明确衡量约束满足和结构有效性,而不是单纯依赖以准确率为中心的报告。

信息来源