LiteLLM v1.99.0发布:新增模型弃用预警、Amazon Comprehend Medical支持及Valkey向量存储
LiteLLM v1.99.0为代理新增模型弃用预警端点,加入AWS Comprehend Medical透传与Valkey向量存储,并全面迁移管理UI到新组件库。
LiteLLM发布v1.99.0,官方公告显示该版本为代理网关新增模型弃用预警与 /model/deprecations端点、Amazon Comprehend Medical透传提供方,以及Valkey受管向量存储提供方。版本同时包含大量管理UI重构和多项修复。
据changelog,v1.99.0引入“主动模型弃用提醒”功能,管理员可通过新端点查询即将弃用的模型,以便提前迁移。
LiteLLM v1.99.0增加对AWS Amazon Comprehend Medical的透传支持,允许直接调用该医学文本分析服务。
UI方面,LiteLLM管理面板大量表单从antd和tremor组件迁移到react-hook-form与shadcn,据提交说明这旨在统一界面与交互。
核心修复包括:修正批次任务计费(对取消但仍有输出文件的批处理计费)、Azure gpt-5-chat部署的max_tokens改名、以及阻止回调凭据泄漏到请求元数据。
模型弃用预警与新增提供方
LiteLLM v1.99.0引入模型弃用预警功能,管理员可以通过新端点 /model/deprecations查询即将弃用的模型。该变化来自PR #26900,由mateo-berri提交。
新增Amazon Comprehend Medical透传提供方 (PR #37229),允许LiteLLM用户将请求直接转发至AWS医学文本分析服务。这意味着医疗信息处理场景可以复用LiteLLM的统一路由和管理能力。
向量存储方面,版本将Valkey添加为受管向量存储提供方 (PR #37002)。Valkey是Redis的开源替代。同时,路由器的Responses API输入现在也经过auto-router处理 (PR #37333)。
- 新增模型弃用预警端点 /model/deprecations
- 新增Amazon Comprehend Medical透传provider
- 新增Valkey作为受管向量存储provider
管理UI重构
本次版本包含大量管理界面重构。多个表单(包括预算、技能、标签、记忆、Auto Router、凭据、Guardrail、Vector Store、SSO、SCIM、Vault等)从antd或tremor迁移到react-hook-form和shadcn等现代组件库。例如,Dashboard toasts迁移到sonner (PR #37307),MCP server forms和detail tabs移除了tremor依赖 (PR #37329)。
UI交互也有改进:添加了用户ID请求日志过滤器 (PR #36781),密钥信息头部现在链接到其用户、创建者、团队和组织 (PR #37187),并修复了团队预算与密钥无预算时错误配对的问题 (PR #37196)。
测试覆盖有所增强,开发者添加了多项UI测试以验证表单校验和异步行为,提高CI稳定性。
- Auto Router创建/编辑表单支持plan-mode覆盖层级
- 新增 /team/daily/activity/aggregated端点用于使用情况展示
- Usage页面改用新的团队日活动聚合端点
关键修复
v1.99.0修复了多个批处理和计费问题。批次任务计费现在会把取消或失败但仍产生输出文件的批次计入费用 (PR #37205);批量检索的价格现在根据部署的模型和费率计算 (PR #37219)。Bedrock托管批次上传的FileObject现在报告已上传大小 (PR #36392),并支持通过StopModelInvocationJob取消AWS Bedrock批次任务 (PR #34087)。
针对Azure,gpt-5-chat部署的max_tokens参数被重命名为max_completion_tokens (PR #36857)。Anthropic Responses适配器停止发送空的thinking blocks (PR #36033),并保留可选工具属性 (PR #36979)。
安全方面,修复了回调凭据在请求元数据中泄露的问题 (PR #37233)。同时,代理现在对 /v1/batches的非对象metadata返回 400 而不是静默丢弃或 500 (PR #37203)。
流式响应中,当调用者省略include_usage时,现在会跟踪provider报告的成本 (PR #35013)。成本计算器还识别了“ultrafast”服务层级 (PR #37355)。
- 修复了缓存token使用量被替换的问题
- 修复了向Bedrock转发identity和metadata的代码
- 修复了 /v1/batches中limit超出范围时的错误处理