研究Amazon Science·2026年9月5日

亚马逊发布SOP-Bench基准测试,用真实企业规程检验AI代理执行能力

该基准覆盖12个业务领域的2000多个任务,附带可用工具和标准答案,实际测试显示新版Claude模型性能可能不如旧版。

AI解读:SOP-Bench要解决的是AI代理在真实业务流程中"看起来行、做起来不行"的问题。以前的大多数测试只考查单一能力,比如选对API或遵守规则,而且输入都是干净的机器格式;但企业的标准操作流程(SOP)充满省略和歧义,比如步骤说"核实保险"却不解释怎么核、为什么核两次,人类靠行业默契能理解,AI只能猜。于是亚马逊让领域专家从真实工作流写SOP,再用AI辅助生成工具接口、模拟API和包含边界情况的测试数据,专家最后逐项把关,把每道题都配上确定答案,代理必须实际调用工具走完流程才能得分。测试结果有几个直接影响选型的发现:在推理型代理上,Claude 4.5家族得分反而不如稍旧的Claude 4家族;给一个视频标注任务塞进20个无关工具,成功率几乎减半;13个流程中推理型代理只在8个上领先,平均每个任务耗时多三分之一。对正在用大模型做业务自动化的团队,这意味着不要盲目升级模型或堆工具,应该用自己实际的SOP先测一遍,因为升级后可能性能下降却没有任何信号。普通读者不需要特别行动,这个基准的价值主要给开发代理和负责技术选型的人。

亚马逊科学团队在KDD 2026大会上发布SOP-Bench,一个用于评估AI代理执行真实企业标准操作流程(SOP)能力的开源基准测试框架。该基准覆盖医疗分诊、危险品分类、客户服务、内容审核、金融合规、仓库检查等12个业务领域,包含超过2000个任务。每个任务附带代理可调用的工具接口和标准答案,代理须通过调用工具完成任务来获得评分,而非靠文本生成取悦自动评分器。亚马逊称这是首个将真实企业流程、可用工具和真实答案三者结合的同类基准。

构造方法与发布内容

SOP-Bench的构造采用专家与AI配合的方式:专家基于真实工业流程编写原始SOP并设定任务背景,然后由Anthropic Claude 3.5 Sonnet v2模型完成机械性工作——将流程转为机器可执行格式、生成数据模式、模拟API及工具规格、工具代码和混合了常规、边界与失败案例的数据集。每个生成结果均由专家复核逻辑、修正流程、检查数据并运行代码确认,全程未涉及专有或敏感数据。

基准以框架形式呈现:每个流程由SOP文本、工具、工具规格和带已知答案的测试用例四部分组成。研究团队或开发者可以放入自家代理进行测试,也可添加新流程。框架会记录每次工具调用和推理轨迹,并对照标准答案评分,结果可复现,失败点可回溯到具体步骤。

全部内容已在GitHub和HuggingFace上发布,包括12个专家编写的流程、生成的工具与数据集、两个基线代理和评估代码。团队还计划增加同一流程的更难变体、含图片和表格的指令,以及要求代理中途切换上下文的嵌套结构流程。

测试发现:模型越新不代表越好,工具越杂反而更差

团队用两个简单代理设计——函数调用型代理和推理型(ReAct)代理——测试了11个前沿模型。结果显示若干反直觉模式:升级模型有时会降低性能,在推理型代理上,较新的Claude 4.5家族得分低于较旧的Claude 4家族。团队提醒,这对生产环境的代理团队尤为重要,常规升级可能降低成功率且无明显信号,唯一可靠的发现方式是针对实际运行的流程进行测试。

工具数量同样影响结果。团队将同一个视频标注流程给代理两种工具包版本:一种只含任务必需的6个工具,另一种在6个必需工具外加了20个看似合理但无用的工具。代理在更大工具包下成功率几乎减半。团队因此认为,精简代理工具使其匹配任务可能是部署准备的关键一环。

不同流程之间成功率差距大:在最容易的邮件意图分拣任务上,代理约十分之九得到正确答案;在最难的驾驶视频物体标注任务上,正确率仅约四分之一。模型与代理的组合没有一种能在所有流程上领先,某一流程上最好的组合可能对另一流程是较差选择。

代理的构建方式与使用的模型同等重要。在相同模型上对比两类代理,推理型代理平均略优,但只在13次流程运行中的8次获胜,且每个任务多耗时约三分之一。不同流程对代理类型偏好不同,应据流程形态选择代理,而非依赖整体平均。

一个尚待解答的问题与直觉相悖:以长段阅读为主、仅在少数几处需做决策的流程,反而比包含更多决策点的流程给代理带来更大困难。团队称不能断言长文本是成因(两种流程在工具数量等方面也有差异),但认为这正是该基准可帮助后续研究的问题。测试结果的平均任务成功率(TSR)按模型和代理类型汇总显示:函数调用型代理仅用Claude模型评估,因依赖其原生工具调用;推理型代理用全部模型评估以对比推理能力。

查看原图 · 1200 × 630
查看原图 · 1200 × 675
查看原图 · 1748 × 1158
查看原图 · 1200 × 795
查看原图 · 1748 × 1251
查看原图 · 1200 × 859
查看原图 · 1748 × 787
查看原图 · 1200 × 540
查看原图 · 1748 × 989
查看原图 · 1200 × 679

信息来源

Amazon Science原始来源