产品Databricks Blog·原文 2026年9月2日本站收录 2026年9月7日

Databricks用OpenTelemetry追踪加Genie One,一小时定位并修复七个工具Bug,每年省下120万美元AI Agent浪费

Databricks工程师发现Agent在工具调用失败后不会大声报错,而是静默重试,浪费token和等待时间。借助Unity Gateway的追踪数据和Genie One的自然语言查询,他们在约一小时内找到七个工具服务器Bug,每年可节省约49.9万美元token成本和1.2万工程小时。

AI解读:AI Agent看似完成任务,但背后可能隐藏着大量浪费:当工具调用失败时,Agent不会立即报错,而是反复重试、猜测,消耗token和等待时间。Databricks通过Unity Gateway记录所有MCP工具调用的追踪数据,再用Genie One用自然语言提问,发现七个工具服务器Bug,每年浪费约49.9万美元的token和1.2万工程小时,总计约120万美元的生产力损失。修复本身很简单,关键在于如何快速找到问题所在。这项实践表明,让Agent行为可观测、可查询,是控制AI成本的关键。对于其他重度使用AI Agent的团队,尤其是自建工具或MCP服务器的开发者,与其猜测成本去向,不如先为工具调用加上追踪,用自然语言分析找出重复错误。普通用户无需立即行动,但可以关注工具错误信息的设计——清晰的报错能显著降低恢复成本。

Databricks工程师发现AI Agent在工具调用失败时往往不会直接报错,而是静默重试或猜测,造成token和时间的浪费。借助Unity Gateway的OpenTelemetry追踪数据和Genie One的自然语言分析,团队在约一小时内定位并修复了工具服务器上的七个Bug,每年可节省约49.9万美元的token成本和约1.2万工程小时的等待时间,合计约120万美元的生产力损失。

七个小Bug每年浪费49.9万美元token和1.2万工程小时

  • Databricks内部广泛使用AI Agent,但这些Agent依赖MCP工具访问系统日志、工单、Wiki等资源。工具失败时,Agent不会停止,而是重试、猜测,最终绕行,静默消耗token。
  • 通过Unity Gateway自动为每次MCP工具调用生成OpenTelemetry追踪,记录工具名、参数、错误、token数、延迟和会话ID,数据存于统一表中,无需额外部署。
  • 使用Genie One以自然语言查询追踪数据,团队在约一小时完成发现、量化、修复的闭环。
  • 24小时窗口内发现七个Bug,主要出现在Jira和Google Drive/Docs工具服务器上,累计每天发生1409次错误,每年浪费约49.9万美元token和12023小时等待时间。
  • 最高频Bug:Jira的'list' object has no attribute 'split',每天535次错误,每年浪费8.7万美元token和4850小时;原因是服务器期望逗号分隔字符串,而模型传了JSON数组。
  • 另一例:Google Drive的Invalid field selection错误占drive_file_get调用的49.6%,因为模型传了看似有效的字段名(如id、name、mimeType),但端点不接受。

错误信息质量直接影响恢复成本

  • 数据显示,错误信息质量与恢复成本高度相关。自解释的错误(如"find_text and replace_text required")重复率14%,平均4.6步恢复;而模糊的Python traceback(如'list' object has no attribute 'split')重复率30.5%,平均12.1步恢复。
  • 最差的错误是误导性的(如"unexpected keyword argument 'analysis_prompt'"),重复率50%,平均13.1步恢复。
  • 工具签名往往故意宽松以节省上下文token,但这导致模型用合理猜测填补空缺,而服务器只接受一种输入形式,未匹配时崩溃。
  • 设计原则:工具应适应LLM的自然调用方式——将list强制转为字符串、为缺失参数提供默认值、容忍意外参数,而不是对不符的第一次输入就报错。

信息来源

Databricks Blog原始来源