LangChain发布eval-engineering技能:以“世界规格”驱动合成Agent任务生成
LangChain详细介绍其内部构建合成Agent评测环境与任务的两阶段流程,并更新了eval-engineering技能,帮助团队从生产trace中持续生成评测基准。
AI解读:这条新闻对正在构建Agent评测集或做模型迭代的团队最有用。LangChain把过去人工编写评测任务的做法,拆成两步流水线:先根据trace、代码或人工输入生成一份用自然语言写的任务规格(task spec),再用编码Agent把规格转换成可在Harbor框架中运行的具体任务。关键设计是引入了“世界规格”(world spec)——一份独立于单个任务、但适用于整个数据集的项目级知识库,其中包含后端API schema、数据生成脚本、评分规则建议等,这样当你要为同一Agent生成几十个任务时,就不必每次都重写环境细节。LangChain还提到,生成完首批任务后,需要人工介入校准难度,因为Agent倾向生成过易的任务。如果你正为Agent做回归测试或后训练,可以把LangChain的eval-engineering技能加载到你的编码Agent中,按文中给出的示例提示词开始生成任务。但注意这是LangChain内部实践的方法论,不是即插即用的产品,你需要自己投入精力完善world spec。
LangChain于 3 月 17 日发布官方博客,详细介绍了其内部构建合成Agent环境与评测任务的方法,并更新了对应的“eval-engineering”技能,供团队用生产数据持续生成高质量评测集。
该流程的核心是一个两阶段pipeline:第一步,结合trace、代码或人工输入,生成一份详细的任务规格(task spec,用markdown描述任务的输入、环境与评分规则);第二步,使用编码Agent将该规格转换为可在LangChain开源框架Harbor中运行的任务和数据集。
为支撑这两个步骤,LangChain引入了“世界规格”(world spec)概念,用于在数据集级别集中存储跨任务通用的知识,例如后端API schema、数据生成脚本、常用评分函数等,而每个任务独有的细节则保留在task spec中。
两阶段pipeline:规格生成与规格到任务转换
LangChain认为,构建评测基准的核心难点在于每个任务都需要有代表性的输入、贴近真实世界的环境,以及与之匹配的评分标准。人工单独构建任务耗时费力,因此他们采用流水线方式:先集中完成“任务规格”的编写与人工评审,再批量自动生成任务。
规格文件作为人类与Agent协作的媒介,便于版本化管理,也便于跨团队共享。LangChain内部用于生成规格的数据类型包括:GTM工程测试(如公司调研、跨表查找缺失人员)、提示词优化评测、基于真实合并PR的代码审查任务,以及在大规模trace语料中挖掘少量问题的任务。
“世界规格”的迭代式构建
LangChain建议通过与编码Agent配合完成首个任务,随后让Agent顺带总结出一份“世界规格”,用来沉淀通用的数据形态、解析脚本、评分函数等。反复两三轮后,世界规格会趋于完整。
World spec的构建过程需要编码Agent执行多项操作:扫描代码库以定位Agent使用的提示词、工具和技能;对trace分组以发现真实用户请求模式;梳理运行Agent所需的凭证与外部服务(如Salesforce、Gong)的数据schema;分析数据层级关系并制定合成数据生成策略。每个步骤都需要人工反馈迭代。
Spec2Task环节的学习:难度校准与数据生成指导
在spec到任务的转换阶段,LangChain发现几个关键经验:首先,任务生成后应使用真实Agent运行并检查轨迹,以发现环境设计缺陷,例如过于具体的指令或“泄漏抽象”(如表中出现“Answer placeholder”之类的占位文本)。
其次,难度校准很重要,LangChain会用不同档次的模型(文中示例为gpt-5.6-Luna与gpt-5.6-Sol)运行同一任务,观察难度是否匹配目标模型层级,并检查是否存在奖励攻击(reward hacking)。
此外,Agent不擅长自行选择数据生成方法,LangChain会为其提供明确指导:自由文本数据用带评分标准的LLM生成,表格数据则用sqlite脚本配合预定义schema生成。
- 示例流程提示词:用evAL-engineering技能与traces创建首个任务 → 审查世界规格 → 生成第二个任务以验证世界规格 → 按需调整难度与数据多样性 → 扩展生成更多任务规格与任务。
人工仍不可替代的两个环节
该流程并非全自动。LangChain指出两处仍需人工判断:一是规格打磨往往需要多轮反馈,以确认规格是否真实反映业务领域、用户行为与任务需求;二是Agent生成的基准任务通常难度偏低,校准难度需要反复运行任务、审查轨迹并明确要求Agent调高或调低难度。
评测环境需持续演进
LangChain强调,Agent评测环境应随生产数据与模型变化不断更新。这种环境可用于提示词调优、工具配置测试或后训练,也可以用来评估“某类任务是否可用更便宜的模型”“能否移除工具只用bash”等问题。eval-engineering技能的设计目标正是支持这种持续迭代的流程。
