LangSmith发布Tuned Evaluators,首个Perceived Error评估器上线
LangChain推出Tuned Evaluators,首个Perceived Error评估器声称以更低成本超越前沿模型,自动评估生产对话中的感知错误。
LangChain于[发布日期未知]推出LangSmith Tuned Evaluators,首款评估器Perceived Error旨在自动检测生产环境中对话Agent的错误迹象。据官方博客介绍,该评估器通过专用微调模型,在基准测试中超越前沿模型,并将评估成本降低82%。
Perceived Error评估器的工作原理
Perceived Error旨在检测对话中包含Agent犯错、误解请求或导向错误方向的证据。证据可能来自用户的明确纠正、重复请求、拒绝操作,也可能由模型从矛盾回应、承认错误或未解决的结果中推断。LangChain表示,多数用户从不提交显式评分,因此该信号需从对话本身推断。
- 添加Tuned Evaluator到LangSmith追踪项目后,系统会根据评估器要求筛选符合条件的trace或线程,并由LangChain管理的专用模型进行评估。
- 评估结果及解释会作为反馈附加到对应trace或线程,团队可据此调查失败、构建数据集或优化Agent。
适用条件与定价
线程需至少包含两轮人机消息对,并达到配置的空闲期后方可评估;评估在停止后12小时内完成。Perceived Error现已在美区Plus和Cloud Enterprise计划中开放,每次成功评估收费,跳过或失败的评估不收费。