Sierra开源hyper-𝜏-bench:评估AI模型构建客服智能体的能力
Sierra发布新基准测试,衡量模型从模拟业务记录中自主构建完整客服智能体的能力。
Sierra今日开源hyper-𝜏-bench(论文标记为𝜏^𝜏-bench),这是一个新的长周期智能体评估基准,用于衡量模型不仅作为智能体执行任务,还能自主构建完整智能体的能力。Sierra于2024年发布𝜏-bench,当时主要用于测试模型能否充当可靠的客服智能体。
该基准将开发智能体放入一个模拟业务的沙盒工作区,其中包含模拟企业的记录和可随时通讯的模拟客户。开发智能体需端到端完成:从证据中恢复规格、设计架构、将业务操作转化为工具,直到交付一个能工作的客服智能体。客户端REST API可能包含微妙错误,智能体需判断是规格问题还是代码缺陷。最终智能体必须从固定模型菜单中运行,并遵守每次对话的成本预算;交付后将使用开发过程中未见的完全可验证的𝜏-bench-style测试进行部署评估。