英国AI安全研究所首份前沿AI趋势报告:模型能力激增,通用越狱难度提升约40倍

英国AI安全研究所发布首份《前沿AI趋势报告》,基于两年测试数据量化了最先进AI系统的能力提升,并指出安全防护措施虽有改善但所有测试系统仍存在可被绕过的方式。

AI解读:前沿AI的能力提升速度快得惊人,但安全防护也在跟进。英国AI安全研究所(AISI)基于两年、覆盖网络、化学和生物领域的测试数据,发布了首份《前沿AI趋势报告》,首次由政府机构给出量化证据:AI在学徒级网络任务上的成功率从2023年的不到9%升至2025年的约50%,首次有模型完成需要10年经验的专家级任务;软件工程任务完成率从两年前的不到5%升至现在的超过40%。与此同时,模型的安全防护也在改善,AISI红队找到“通用越狱”方法的时间从数分钟增至数小时,约40倍的提升。但报告明确,所有测试系统仍存在某种可被绕过的漏洞,且防护水平因公司而异。报告不做政策建议,也不预测未来或评估现实风险,只描述受控测试下的表现。对开发者而言,这意味着AI的能力边界正在快速扩展,安全评估需要跟上;对普通用户,无需立即行动,但可以期待更透明的能力披露和更严格的安全标准。

英国AI安全研究所(AISI)于2025年发布首份《前沿AI趋势报告》,基于两年对最先进AI系统在网络安全、化学和生物学等关键领域的测试,首次由政府机构提供关于前沿AI能力的量化数据。报告显示,模型在多个领域的表现显著提升,例如在学徒级网络任务上的成功率从2023年的不足9%升至2025年约50%,并在2025年首次有模型完成需要十年经验的专家级任务。软件工程方面,模型完成时长一小时任务的成功率从两年前的不足5%提升至超过40%。

报告还指出,AISI红队发现“通用越狱”(绕过模型安全规则的一般方法)所需时间从数分钟增至数小时,意味着约40倍的改善,但所有测试系统仍存在某种可被绕过的方式,不同公司的防护水平参差不齐。

报告性质与局限

报告并非政策建议,也不预测未来或评估现实世界风险,仅描述受控测试下模型的实际能力。AISI强调,这些测试不代表真实世界使用,但提供了关于前沿AI提升速度的稳健科学图景。

官方表态

AI部长Kanishka Narayan称,报告体现英国对AI负责任发展的重视,强调与开发者合作测试系统、发现漏洞并在广泛使用前修复。首相AI顾问兼AISI首席技术官Jade Leung则表示,这是政府机构迄今提供的最有力的公共证据,显示前沿AI的快速进步,凸显独立评估的重要性。

查看原图 · 1200 × 630

信息来源