产品Databricks Blog·原文 2026年9月2日本站收录 2026年9月5日

Databricks发布《AgentOps大手册》:系统化AI代理生产运维实践指南

该电子书从架构、部署、评估到干系人管理,覆盖六大章节,旨在帮助企业将AI代理从试点推进到可靠的生产系统。

Databricks于2025年发布《AgentOps大手册》(The Big Book of AgentOps),这是一份面向企业团队的电子书,系统梳理AI代理从开发到生产运维的实践方法。AgentOps被定义为构建、部署和改进生产环境中AI代理的运维纪律,涵盖架构、评估、可观测性、治理、安全和成本管理,旨在让团队能重复执行这些流程。

Databricks认为,AI代理不仅是模型生成响应,还能在运行时选择工具、检索企业数据、调用API并自主完成多步骤任务,这些能力各环节都可能出错,如工具调用错误、权限过宽或未规划的成本激增。AgentOps的目标是控制这种复杂度,使系统足够可靠并获得信任,同时足够简单以便团队实际运维。

六个章节覆盖从概念到实施的路径

电子书分为六章,从AI代理架构、部署模式、项目生命周期、DevOps原则应用、运维规划到干系人管理。第一章分析四种代理架构及其运维要求,并列出常见反模式,如用例过宽、过早采用多代理编排、不必要的推理循环以及过晚开展评估。

第二章介绍四种部署模式,从单一Databricks工作区到多账户多代理企业拓扑,并说明如何根据需求选择和演进,底层依赖Unity Catalog、Unity Gateway和MLflow。

第三章提出一个七阶段项目生命周期,从团队组建、用例选择到数据基础设施、评估循环和治理。特别强调成本管理:单个用户请求可能因子代理、重试和护栏检查触发多次模型调用,因此需要对使用量归属、设置限额并明确支出责任。

第四章借用《DevOps手册》中的流动、反馈和持续学习原则,说明它们如何应用于AI代理系统,包括从真实轨迹构建黄金评估集、用领域专家反馈校准自动化评判,以及用评估结果驱动后续开发。示例展示了客户邮件代理如何结合人工评审、基于模型的评判和基于规则的检查,而无需将每次发布变成手工审计。

第五章提供六步规划序列,包括映射人工工作流、转化为技术架构、按角色定义可观测性需求、设计追踪机制、映射访问控制以及识别可复用部分,并通过一个电信客户支持代理案例具体说明数据模式、账单子代理可用的工具及防止客户数据串扰的细粒度控制。

第六章指出技术支持并不能保证代理上线,项目常因人的问题停滞。生产就绪需要高管发起人、产品负责人、领域专家、安全、合规和财务等各方协调一致,书中提供RACI矩阵来明确责任归属,并给出上线前后各阶段的沟通节奏建议。

案例数据与平台实践

Databricks在书中引用多个客户成果:FactSet的文本转代码知识代理从单一基础模型演进为完整代理系统,准确率提升44%;DXC Technology在生产环境运行三个AI代理,另有八个在试点或开发阶段,迁移到Databricks后平台总拥有成本降低30%;洲际交易所(ICE)在受治理的文本到SQL应用中实现77%的语法准确率和96%的执行匹配率,覆盖约50个查询。

Databricks还报告,在Block的代理系统支持下,Block的Databricks环境兼顾AI和运营用例,Unity Catalog跨业务部门管理数据访问,为其卖家运营AI代理系统带来1000万美元的生产力收益。这些数据来自Databricks的客户故事博文,具体测量方法未在本书中详述。

书中强调的三大最佳实践是:从简单架构起步、从第一天就构建评估、统一可观测性与治理。评估应始于领域专家评审真实轨迹,而非少量精心挑选的聊天提示;治理应采用平台层面方法,通过MLflow、Unity Gateway和Unity Catalog集中管理数据访问、模型和工具使用、追踪、评估和策略执行。

信息来源

Databricks Blog原始来源