研究:安全顶会可复现工件中近45%的静态分析发现具安全相关性

arXiv论文分析2023至2025年四大安全会议1388件研究工件,提出SAFE框架以94.40%准确率区分安全相关与非安全发现,旨在补充现有工件评估流程。

AI解读:安全研究论文常附带可复现的代码工件,顶级会议的工件评估(AE)只验证这些代码能否按论文描述运行,并不检查它们是否可能被滥用。这篇arXiv论文统计了2023至2025年间四大安全会议发布的1388件工件,经静态分析得到132431条候选发现,其中44.80%被认为有安全相关性——意味着近半数的公开代码包含可能被恶意利用的模式。作者提出SAFE框架,用代码语义、执行上下文和实际可利用性来筛选工具报告,区分安全与非安全发现的准确率达94.40%,F1分数93.60%。对真正会复用安全论文代码的研究人员来说,这个工具能帮助他们在消化他人代码时更快识别潜在风险;对会议组织者,它提供了一个在不增加人工负担的前提下扩大评估范围的方向。但需要注意,该数据来自作者自己的测试集,SAFE尚未被会议采纳为正式评估流程,而且静态分析本身无法捕捉所有运行时风险。

arXiv上的一篇论文研究了2023至2025年间发表于四大安全会议(top-4 security conferences)的1388件研究工件,通过静态分析得到132431条候选安全发现,其中44.80%被判定为具有安全相关性。该论文由Nanda Rani和Christian Rossow撰写,提出了SAFE(Security-Aware Framework for Artifact Evaluation)框架。

现有工件评估不检查安全风险

论文指出,研究工件被广泛共享以支持可复现性,工件评估(AE)已成为许多顶级会议的常见环节。但AE主要检查工件是否按声明工作并可复现,并不旨在发现或缓解潜在安全风险。由于这些工件公开发布并被复用,它们可能无意中为滥用创造机会,引发关于安全和负责任共享的担忧。

作者为此提出一种用于上下文感知安全评估的分类法(taxonomy),并据此检查发现以过滤误报,识别代表合理的、依赖上下文的安全风险。

SAFE框架的性能指标

为支持可扩展分析,论文提出SAFE,一个自主框架,基于代码语义、执行上下文和实际可利用性评估工具报告的发现。SAFE在区分安全相关与非安全发现上达到94.40%的准确率和93.60%的F1分数,在分类安全风险类型上达到92.40%的准确率和81.10%的F1分数。

论文总结称,上下文感知的安全评估是现有AE流程的实用补充,能够支持更安全和更负责任的研究工件共享。SAFE的源代码已在论文中公开。

信息来源