开源litellm Releases·原文 2026年8月23日本站收录 2026年9月5日

LiteLLM v1.98.0发布:为所有Docker镜像启用cosign签名验证,并新增多项路由与成本追踪功能

BerriAI发布LiteLLM v1.98.0,所有Docker镜像均已用cosign签名,用户可通过固定commit hash验证镜像完整性;同时引入PTU成本归属、逐部署故障策略覆盖、SSE心跳等多项更新。

AI解读:LiteLLM v1.98.0的主要变化是安全性和可观测性增强。现在所有Docker镜像都使用cosign签名,并提供一个固定的commit hash(0112e53)对应的公钥,用户可以据此验证镜像未被篡改——这对生产环境部署尤为重要,因为供应链攻击往往通过伪造镜像进行。对于使用LiteLLM代理管理多个模型的企业,这次更新还带来了更细粒度的控制:可以为每个模型部署单独设置允许失败次数(allowed_fails_policy)和冷却时间(cooldown_time),避免某个故障模型拖垮整个路由;另外,PTO(Provisioned Throughput)的固定费用现在可以按模型归属到具体key、团队和标签,并计入每日活跃度报表,有助于更精确地追踪成本。管理员还能在UI中直接配置虚拟key的路由设置,并在向量存储页面查看索引。对于普通用户,这些变化不需要立即行动;但对于部署了LiteLLM代理的团队,建议了解镜像签名验证方式,并在配置路由时考虑新的故障策略和成本归属选项,以减少运维摩擦。

LiteLLM v1.98.0于 2025 年发布,从此版本起所有LiteLLM Docker镜像均使用cosign签名,每次发布均使用提交 0112e53中引入的同一密钥。安装说明推荐使用固定commit hash验证镜像,命令为:`cosign verify --key https://raw.githubusercontent.com/BerriAI/litellm/0112e53046018d726492c814b3644b7d376029d0/cosign.pub ghcr.io/berriai/litellm:v1.98.0`;也可使用release tag(依赖仓库的标签保护)进行验证。

除镜像签名外,v1.98.0引入了多项针对Bedrock的修复,包括:为Claude Sonnet 5的Converse调用移除toolSpec.strict(由kr0k提交),为GLM 5和DeepSeek V3.2启用原生结构化输出(alexshtf提交),以及在Invoke /v1/messages中为Haiku 4.5发送tool-search beta头(mateo-berri提交)。

新增路由与故障策略控制、按部署覆盖配置

路由层新增按部署的 `allowed_fails_policy` 和 `cooldown_time` 覆盖支持(deepanshululla提交PR #34416),并修复了故障备胎部署的冷却问题及Redis回填后的TTL错误(PR #35104)。

新增按key的提示缓存开关 `enable_prompt_caching`(ryan-crabbe-berri提交PR #36466),并支持按key、团队和模型配置预估输出token数(yassin-berriai提交PR #36143)。

路由组现在可作为虚拟模型调用,并列入 /v1/models列表(tin-berri提交PR #36519);新增required-AND (&) 标签前缀和 `allow_fail_open` 标志(deepanshululla提交PR #36193)。

  • 代理层新增全局SSE心跳ping间隔,适用于OpenAI形状的流式路由(PR #36154),并支持按部署设置keepalive_seconds心跳以防止负载均衡超时(PR #34423)。
  • 新增GET /v1/indexes接口以列出向量存储索引(ryancrabbe-berri提交PR #36289),UI的Vector Stores页面同步显示索引(PR #36306)。

PTU成本追踪与批量成本归属

此版本为Provisioned Throughput(PTU)新增扁平成本配置,支持按模型部署设置固定费用(yucheng-berri提交PR #35341),并实现了按活跃小时写入每模型PTU固定成本的每日汇总(PR #35343),以及在每日活动读取路径上显示PTU固定成本(PR #35391)。

Vertex和Anthropic的pass-through批量成本现在归属到创建它的key、团队和标签(分别由yucheng-berri提交PR #34456 和PR #36468)。PTU固定成本归属默认通过opt-in环境变量启用(PR #36138)。

文件列表与批处理、成本计量修复

修复了代理中文件列表分页游标的作用域问题(PR #36093),确保返回的 `has_more` 为false时正确报告(PR #36326),并阻止 /{provider}/v1/files路由误捕获 /openai_passthrough(PR #36092)。

批量回退现在保持在拥有文件的模型组内(PR #36181),修复了批量日志在管理对象写入前剥离NUL字节(PR #36688)。

成本计量方面,修复了流式pass-through Responses的成本追踪(williamxue提交PR #36529),并在 /cost/estimate中转发已解析的提供商和部署定价(PR #35880)。

其他重要修复与改进

修复了AWS请求使用部署凭据的问题(PR #36160),以及Anthropic中途系统纠正的保留(PR #34290)。

UI中多个页面根据角色能力进行权限控制,包括日志、组织和代理使用视图(由yuneng-berri提交多个PR)。

多个UI组件迁移到shadcn,包括成本优化、成本追踪、管理面板、用户仪表板、提示词、团队设置和模型端点等页面。

调度后台任务在作业和pod之间错开执行(PR #36589),每日消费批次现在使用单个upsert语句写入(PR #36448)。

修复了并发模型写入互相驱逐的问题(PR #36687),并改进了预算重置的原子性(PR #36287)。

新增模型价格更新,包括NVIDIA Nemotron 3.5 Lightning(OpenRouter和DeepInfra)以及Bedrock、Mistral、Cohere和Gemini模型的弃用日期(PR #36696、PR #36538)。

文档与测试改进

文档要求CLAUDE.md注释规则提供明确例外,并在变更PR模板中增加注意事项部分。

测试套件增加了对Google-native generateContent、prometheus队列时间和供应商API覆盖的复现测试(PR #34650、PR #34557)。

测试移除了从不执行的镜像文件(PR #34635、PR #36681),并修复了被后续定义遮蔽的测试名称(PR #36685)。

信息来源

litellm Releases原始来源