LiteLLM v1.101.0-dev.2发布:新增按用户消费告警、密码策略与MCP语义工具搜索
该开发版为AI网关引入多项功能:Slack按用户消费阈值告警、可配置密码策略和仅SSO登录、MCP语义工具搜索,并统一修复Azure、Bedrock等多provider兼容问题。
AI解读:这次LiteLLM开发版的核心变化是让企业管理员能更细粒度地控制访问和成本:新增的Slack告警可按单个用户的日/月消费阈值或异常消费触发,配合fail_closed预算强制,超出预算的请求会被直接拒绝;同时新增的可配置密码策略和SSO-only登录提高了管理后台的接入安全。对于用LiteLLM统一管理多家模型API的团队,这意味着不必再依赖外部脚本盯消费报表,也不怕团队成员绕过SSO用弱密码登录。MCP网关新增的语义工具搜索则让AI Agent在调用工具时能按意图匹配而非仅靠名称,减少工具选错。需要注意的是这只是v1.101.0的开发版,功能尚未进稳定版,生产环境升级前应先在测试环境验证这些告警和认证策略是否符合现有工作流。
LiteLLM发布v1.101.0-dev.2开发版。该版本为AI网关新增Slack消费告警、密码策略与SSO-only登录、MCP语义工具搜索等功能,并修复Azure、Bedrock、Anthropic等多个provider的集成问题。所有Docker镜像均使用cosign签名,可通过固定commit hash或release tag验证签名。
新增安全与可观测性功能
该版本新增Slack告警功能,可监控每个用户的日/月消费阈值和消费异常检测(PR #38438)。新增可配置密码策略和仅SSO登录(PR #39381),并修复 /v1/files和 /upload/logo的文件上传校验(PR #39379)。
审计和日志方面:新增Prometheus按key和team的速率限制指标(PR #39236),日志记录中会隐藏uvicorn访问日志里的凭据查询参数(PR #39293),并修复了内部异常详情泄露给客户端的问题(PR #39380)。
- MCP Gateway新增语义工具搜索(PR #39404),可通过意图匹配工具。
- 上游MCP服务器遵循tools/list分页,报告每个服务器的聚合结果,并限制工具预览和测试连接的超时时间。
跨Provider与模型兼容性修复
模型与定价方面:新增gemini-3.8-flash的day-0定价(PR #39340),模型注册表审计更新了OpenAI、Mistral、xAI等多个厂商的模型和弃用日期(PR #39170),新增meta/muse-spark-1.3(PR #39417)。
修复了多个provider的问题:Azure聊天补全扁平化工具模式(PR #38870);Bedrock Converse在没有SigV4凭据时可能崩溃的问题(PR #39166);针对仅自适应Claude模型的thinking升级(PR #39159);以及Anthropic /v1/messages的安全拒绝回退(PR #39157)。
- 修复了Azure DeepSeek V4 Flash 0731的模型标识,现使用Foundry catalog id(PR #39341)。
- Gemini现在默认返回启用的思考内容(PR #39160)。
- 修复了Ollama工具调用流式传输finish_reason的问题(PR #39010)。
其他修复与内部重构
修复了并发迁移部署死锁导致v2迁移解析器恢复的问题(PR #39187),以及Helm升级时主密钥Secret的复用问题(PR #39219)。
Rust核心与Python桥接层进行了重构,统一了错误处理并增加了同步/异步执行边界(PR #39331、PR #39332 等)。
将流式响应成本计入最终使用量的默认行为(PR #39069)——即流式响应的最终成本现在默认会被正确计入。
- 修复了访问组key同步UPDATE在读写副本上执行的问题,现改为在writer上执行(PR #39128)。
- 添加了Docker镜像签名验证文档,支持通过固定commit hash和release tag验证。