SGLang发布v0.5.19,包含 786 个PR,新增束搜索、DeepEP v2后端、LayerNorm序列并行等特性,并支持Qwen3.8、Spark2.5、Ling-3.0等新模型。
热点
查看完整榜单AI时间线
2026-09-05
v0.60.0-nightly.20260905引入三项安全修复,涉及扩展环境变量、工作区路径边界与符号链接、系统级配置文件的权限校验。
新版SDK为usage reports增加Claude Tag category与用户维度细分,为组织合规设置新增具名状态类型,并在更多端点支持发送workspace ID。
本次更新为OpenAI集成新增异步工具支持,并修复了Google GenAI与Bedrock标准内容中的意外变更(mutation)问题,同时升级了mistune与tornado依赖。
Anthropic发布Claude Code v2.1.261,新增 /skill-doctor帮助精简技能占用,bash输出上限提至 128K,并修复远程控制、插件同步等 40 余项问题。
本次更新将M3加入Metal快速向量(fa-vec)调优表,并为其新增q40、q41、q50、q51四种量化类型的调优,可望提升M3芯片上的推理速度。
新版llama.cpp将sgn、elu、trunc等 9 个逐元素一元算子从CPU回退改为OpenCL执行,并为连续张量拷贝与CONCAT扩展了类型支持。
该版本为Windows on ARM的Adreno GPU新增OpenCL xmem SDPA支持,以优化注意力计算;可通过GGMLOPENCLXMEMSDPA环境变量启用。
OpenAI发布Codex 0.153.3,在Amazon Bedrock的Mantle与Runtime global/US路由中加入GPT-6-Astra,并修正其异步澄清问题的工具指引。
llama.cpp的新版本将版本号提升至 0.4.0,并带来一系列修复与调整,涉及Vulkan、ROCm、SYCL等多个后端,同时更新了ASI相关代码并添加了一组实验性构建。
HyperPod InstantStart以单一容器整合Web界面、REST API和MCP工具,让AI代理可通过对话完成集群创建、扩容、训练与推理部署,所有操作均经同一后端API并具备可重试性。
2026-09-04
llama.cpp发布b10798,llamaprintbuildinfo不再硬编码stderr,调用方可传入FILE;llama-app的version命令输出已切换至stdout。
llama.cpp发布b10797版本,修复了ggml-cpu(s390x) 上q51量化中未初始化vacc的问题,并同步提供各平台预编译二进制。
新版本引入nexpertusedmax函数,解决每层专家数不同导致的加载失败与断言错误,影响含Nemotron-3-Puzzle等分层MoE架构的模型。
新版本在GGMLSYCLENABLEFUSION下合并多个算子,减少内核启动次数;同时提供多平台预编译二进制。
新版本将GGMLSYCLENABLEMKLFA改为全局变量,并提供多平台预编译二进制,macOS KleidiAI与openEuler构建暂被禁用。
本次更新修复了macOS沙箱临时目录隔离问题,并在chrome-devtools-mcp中移除了硬编码的Google CrUX API密钥。
该开发版为AI网关引入多项功能:Slack按用户消费阈值告警、可配置密码策略和仅SSO登录、MCP语义工具搜索,并统一修复Azure、Bedrock等多provider兼容问题。
新版本仅更改界面显示文本,将GPT-6-Astra Fast档描述从“1.5x速度”更正为“2x速度、用量增加”,不改变实际请求运行方式。
Anthropic发布Claude Code v2.1.260,新增全屏模式下的 /diff面板,并修复包括权限规则、Bash沙箱、提示词缓存、模型切换等大量缺陷。
本次更新将GPT-6-Astra模型目录向后移植到 0.153 版本,允许开发者在API中配置该模型,但不会改变默认模型或在模型选择器中显示。
该版本针对OpenCL后端进行了多项性能优化,涵盖量化lmhead、解码GEMV和中批量GEMM,并包含特定硬件(如Adreno GPU)的调度与正确性修复。
新版本唯一变更针对SM87(推测为NVIDIA Blackwell架构)内核,调整了矩阵乘法向量量化(MMVQ)与矩阵乘法量化(MMQ)之间的交叉切换条件,未涉及其他功能更新。
该补丁版将包版本升至 1.80.1,SDK更新至 10.0.303,并清理了与已退役OpenAI Assistants相关的测试与配置文件。
新版本引入langchain.mcp模块和MCPAdapter,为Agent提供工具路由的模型目的地修复,并优化Anthropic中间件追踪性能。