产品Databricks Blog·原文 2026年9月9日

Zepto每日超10万张客服工单由AI处理,基于Databricks评估框架上线

Zepto与Databricks合作构建“评估优先”的多智能体客服系统,80%以上工单由AI处理,客服成本降低65%,CSAT提升20%。

AI解读:Zepto的客服系统每天处理超过10万张工单,但此前“只管上线”的开发方式在规模扩大后暴露出问题:1%的错误率就意味着每天数千次糟糕体验和真实收入损失。为此,Zepto与Databricks合作,把评估环节变成智能体开发的核心基础设施——所有提示词、模型或逻辑的改动,都必须先在golden dataset(黄金数据集)上跑回归测试,通过质量门禁才能上线。

这套方法带来的直接变化是:80%以上的工单由AI代理处理并有人工监督,客服成本降低65%,CSAT(客户满意度)提升20%,开发周期快3倍,问题解决速度快4倍,回本周期不到一个月。对于其他正在规模化部署AI客服的公司,这个案例的核心启发是:真正的瓶颈不在模型能力,而在如何用数据和质量门禁系统性地发现和拦截失败,而不是等客户投诉后再修补。

Zepto是印度增长最快的即时电商平台之一,覆盖超过60个城市、销售数千种商品,配送时间以分钟计。据Databricks官方博客介绍,Zepto的客服目前运行在一个多智能体AI系统上,每天处理超过10万张工单。

Zepto与Databricks合作构建了“评估优先”的智能体开发框架,核心做法是把评估作为智能体构建、测试和运维的首要环节,而非事后补充。据博客称,这套系统取得了多项量化成果:80%以上的工单由AI智能体在人工监督下处理,客服成本降低65%,回本周期不到一个月;CSAT(客户满意度)提升20%,准确率提升8%;开发周期快3倍,问题解决速度快4倍。

为什么“只管上线”会在规模化时失效

博客称,在每天超过10万张AI工单的情况下,即使只有1%的错误率,也会产生数千次糟糕结果和真实的收入损失。压力来自多个方向:天气事件、排灯节和夏季开始导致工单量急剧飙升;从杂货扩展到服装、电子产品和美妆,带来了新的退款、换货和退货流程;更多样化、多语言的客户群体带来了更广泛的请求类型。

博客指出的核心问题是“保证差距”(assurance gap):智能体系统是多步骤工作流——分类意图、检索知识、分析输入、推理决策、调用事务性工具、生成回复——失败可能出现在任何环节,而不只是最终答案。由此产生的具体问题包括:失败在客户投诉前不可见、修复缓慢、最终答案掩盖了内部错误、缺乏在成本/性能/质量之间做平衡的原则性方法、设计未覆盖所有关键利益相关方视角、快速迭代下可靠性难以保证。

双循环架构与七个建设阶段

博客详细描述了Zepto采用的“双循环”模型:开发循环负责在发布前设计、迭代和评估智能体版本;生产循环负责监控实时行为、检测失败;质量门禁控制两个循环之间的流转,决定哪些版本可以进入生产、哪些需要退回开发。任何失败都会自动被捕获并反馈到开发循环。

框架建设分为七个阶段。第一阶段启用追踪:使用MLflow的mlflow.autolog() 一行代码开启自动追踪,配合 @mlflow.trace装饰器增加自定义span,轨迹以OpenTelemetry格式实时输出,并通过Unity Catalog集中记录到Delta表中。

第二阶段设定评估维度:从每个利益相关方视角定义“成功”的标准,形成评估支柱(evaluation pillars),每个支柱有明确的数字阈值,部署前必须达到。典型支柱包括客户体验、运营效率、风险合规和财务影响。

第三阶段构建黄金数据集:作为开发循环中评估智能体行为的事实标准,覆盖正常、边界和失败场景,包含不同利益相关方的期望示例,并带有场景类型、业务线、风险等级等元数据注释。安全团队会贡献对抗性示例,如提示注入、身份攻击和数据外泄尝试。Zepto在六个月内将MLflow评估数据集从500个示例(开发与生产准确率差距8个百分点)扩充到2,000个示例(差距2个百分点),再到5,247个示例(差距0.4个百分点)。博客称,在数据集质量上花费的每个小时可节省约十个小时的生产调试时间。

第四阶段自动化提示词工程:使用MLflow提示词优化,注册初始提示词,生成并优化变体,针对与部署门禁相同的评分器自动运行A/B评估,部署最佳结果。优化器使用强模型进行反思,生产环境用更便宜的模型来评分,使搜索过程本身具备成本意识。

第五阶段定义评分器并设置“AI陪审团”:MLflow提供三种创建方式——内置评判器、自定义评判器和基于代码的评分器(用于工具延迟、工具调用次数等确定性指标)。团队只在需要人类判断时才使用基于LLM的评分器,确定性逻辑用简单规则即可。评判器与人类标签校准达到80-90%的一致性,高风险决策使用多个评判器。

第六阶段建立模型可选择性:通过改变Databricks中的模型名称即可在专有和开源模型间切换,使开发循环能持续搜索成本/性能/质量的最佳组合。第七阶段建立自动化回归:任何更改都会触发自动回归评估,可靠性得到保证后自动部署。典型流程是:更改智能体逻辑、提示词或模型后,评估工作流自动触发,以新版本、黄金数据集和当前生产基线为输入运行评估,质量门禁检查新版本是否满足所有门禁(成本、质量、性能等)并至少不比生产基线差,通过则提升至生产,否则拒绝。

生产环境实时安全网与分层采样

生产循环采用分层采样而非均匀采样:评估采样率取决于高价值客户、新功能或最近变更的流程、负面情绪或高升级风险、以及基于图片或易欺诈的交互。这实现了约18-20%的有效评估采样(每天约14,400条轨迹),成本可控,同时捕获45-60%的边界案例,并在4-6分钟内发现问题。博客称,与均匀采样相比,分层方法使每个问题的审查成本降低86%,边界案例检测效率提升9倍。

评估结果写入Delta表,通过Databricks中的仪表板和告警规则展示。关键告警每5分钟检查一次,监控意图准确率下降、groundedness违规、高升级风险和P95延迟违规;高/中等级告警跟踪同情心退化、成本飙升、工具失败率、CSAT趋势、欺诈检出率和多模态延迟。

可组合的智能体架构:垂直与水平分工

Zepto的客服栈将智能体分为两类。垂直智能体是专家,每个负责一个明确定义的意图族:WIMO(订单追踪和预计到达时间)、Missing(未送达或部分订单)、Expiry(过期包装商品)、Returns(退款状态和处理)、Quality(变质农产品)、Unable to Pay(钱包、促销和支付失败)、General(兜底)。水平智能体作为跨用例的监督层,包括Image Deduplication(捕获跨索赔重复使用的图片)和Item Matching and Image Manipulation Detection(验证上传图片与目录商品匹配且未经编辑)。

这种分离带来双重好处:可以按垂直智能体计算指标,如WIMO意图F1或Expiry OCR准确率;水平智能体则在欺诈精度、图片复用和篡改检测等跨领域关注点上评估。每个组件都可单独和组合测量。

四个生产案例:评估框架如何拦截失败

案例一:ETA卡住不动的故障。一个生产问题导致骑手卡在交通中,而智能体因读取缓存数据不断回复“10分钟内到达”。token计数器和告警评分器在5分钟内捕获了重复回答和高升级风险,展示了骑手静止但ETA不变的轨迹。这触发了规则变更:如果骑手静止超过10分钟,智能体现给出诚实更新并主动提供全额退款取消选项。这一洞察衍生出整个功能线:延迟取消、骑手短缺时主动提议取消、设定窗口内无骑手分配则自动取消、高价值客户无理由取消。

案例二:取消功能回归被提前拦截。当Zepto向WIMO智能体添加取消处理功能时,模型开始混淆“我的订单在哪里”、“我想取消”和“我的订单被取消了吗”三种意图。开发阶段的MLflow评估立即发现:整体意图准确率从约92.1%降至87.4%,新增的WIMO_CANCEL和WIMO_CANCEL_STATUS意图F1表现不佳。由于回归在黄金数据集上显现,没有客户看到过问题。提示词优化和数据集更新将整体准确率恢复至约94.2%,优于原始基线,取消API的工具调用F1接近完美。该功能零回滚上线。

案例三:针对人类判断校准多模态智能体。农产品质量评分本身很难,人类评分者之间往往不一致——同一张蘑菇图片可能被评2/5或3/5。团队用Cohen's Kappa测量这种不一致,并将其视为可靠性上限。他们还发现AI倾向于安全选择,将分数集中在3以避免做艰难判断,而人类分数峰值在4和5。因此他们没有仅针对平均值最小化误差,而是匹配人类分数分布的形状。在线评估还揭示了系统未覆盖的情况,如凝乳牛奶作为包装商品上架但需要像新鲜农产品一样判断,以及照片无法显示的味道或气味投诉,这些被路由到单独路径。校准后的基线用于决定每个产品类型使用哪些模型、如何针对人类判断迭代提示词、如何根据真实智能体表现按客户群体调整退款政策。

案例四:堵住滥用后门。退款滥用尝试使用目录图片、编辑过的照片和跨索赔重复使用的图片。多模态评估流水线对图片进行模糊、亮度和分辨率预处理检查,用OCR验证,然后使用三个视觉模型组成的陪审团配合共识规则,决定自动批准还是人工审查。叠加的还有模糊检测、截图检测、重复检测、图片与SKU匹配、图片与所述原因检查以及交付证明验证。

规模化运营的经验总结

博客总结了从规模化运行中得出的原则。第一,绝不要只优化单一指标:团队曾单独追求意图准确率,结果CSAT下降——单独优化意图提升5个点,但延迟增加133%,CSAT下降0.4个点;采用复合多目标评分后,意图提升3个点,延迟仅增加17%,CSAT上升0.2个点。第二,多种视角——LLM评判器、规则检查、人类标签和生产指标——共同创造真相,这种冗余是保险而非浪费。第三,黄金数据集是基础,应尽早投资。

博客原文在此处截断,剩余内容未提供。

信息来源

Databricks Blog原始来源