开源llama.cpp Releases·原文 2026年9月9日

llama.cpp b10867发布:默认在集成显卡上禁用懒张量加载以修复回归

llama.cpp发布b10867版本,引入懒加载模式AUTO,并在AUTO模式下禁用iGPU的懒张量加载,以修复集成显卡回归问题。

AI解读:在llama.cpp中,懒张量加载是一种按需加载模型权重的方式,可减少启动内存占用,但它在集成显卡(iGPU)上引发了回归问题——可能表现为性能下降或不稳定。本次b10867版本新增了懒加载模式AUTO,并默认在iGPU上关闭懒张量加载,从根源上解决这一回归。对于使用集成显卡(如Intel核显)运行llama.cpp的用户,这个版本的默认行为会回归到更保守的加载方式,意味着启动时占用的内存可能增大,但换取的是性能和稳定性提升。如果你是开发者,可以在AUTO模式下手动控制是否启用懒加载,但需要在iGPU上做更多测试来权衡。对于普通用户,如果当前版本使用正常,则无需立即升级,因为此版本主要面向修复。

llama.cpp发布b10867版本,默认在集成显卡(iGPU)上禁用懒张量加载,以修复此前引入的iGPU回归问题。该版本同时新增懒加载模式AUTO。

修复内容

版本说明中显示,本次修改基于拉取请求 #28326,内容包括:为懒加载增加AUTO模式,并修复iGPU回归。具体实现为回滚部分改动,仅保留在AUTO模式下禁用iGPU的懒加载。

  • 在iGPU上默认关闭懒张量加载
  • 新增懒加载模式AUTO
  • 修复了iGPU回归问题

平台与构建说明

该版本提供多平台预编译二进制包,包括macOS(Apple Silicon与Intel)、iOS、Linux(Ubuntu多种架构与后端)、Android、Windows以及openEuler。

  • macOS Apple Silicon (arm64) 的KleidiAI构建被禁用(关联 #23780)
  • openEuler构建被禁用(关联 #23705),但页面仍列出openEuler x86 310p、910b ACL Graph以及aarch64 310p、910b ACL Graph。
  • Windows arm64 CUDA 13构建标记为预览版

信息来源

llama.cpp Releases原始来源