苹果发布Agent Seer:从MCP工具规范自动合成AI代理评估场景
无需人工标注或实时执行工具,仅凭Model Context Protocol规范即可生成带评分和多轮对话的测试场景,覆盖全部工具的规范场景。
AI解读:评估会调用外部工具的AI代理时,传统做法是人工编写测试场景,这需要深厚的领域知识,且难以跟上快速演变的API。Agent Seer的思路是直接从工具规范——函数名、自然语言描述和参数类型——中提取足够信息,自动生成评估场景,无需人工整理或实时接入工具。它基于一份MCP规范,在没有示例、没有实时工具访问、没有领域专门调优的情况下,生成带评分和多轮对话的测试数据。研究在 7 个MCP规范上验证,小型和中型规范都能完整覆盖所有工具。对开发者而言,这意味着可以用更低的成本快速为新的工具生态建立评估集,尤其适合API频繁更新、人工标注跟不上的场景。但需要注意,研究也发现参数schema复杂度是影响生成质量的主要因素,且参数值准确性是最常见的失败点,这意味着在复杂参数的工具上,Agent Seer生成的结果可能仍需人工复核。
苹果机器学习研究团队提出Agent Seer,一种从Model Context Protocol规范自动合成AI代理评估场景的流水线,论文已被ACL 2026第五次自然语言生成、评估与度量研讨会接收。
该方法仅从单个MCP规范出发,无需示例、实时工具访问或领域特定调优,即可生成带评分的多轮对话测试场景。
工作原理
Agent Seer的输入是工具规范,包括函数名、自然语言描述和带类型的参数schema。研究团队观察到这些信息已蕴含足够语义,可用于合成现实的评估场景,无需人工构建或实时执行工具。
流水线首先丰富原始schema,然后生成带评分的场景并合成工具输出,最后扩展为基于模拟数据的多轮对话。研究者在 7 个不同领域和工具套件规模的MCP规范上测试,评估工具调用正确性和对话连贯性。
主要发现
在所有领域均达到较高质量,小型和中型规范实现了完整的工具覆盖。
两个发现:参数schema复杂度是质量变化的最强相关因素,工具套件规模的影响较小且正交;参数值准确性是不完美场景中的主要失败模式,而这一维度在粗粒度的名称匹配指标中不可见。