llama.cpp b10867发布:默认在集成显卡上禁用懒张量加载以修复回归
llama.cpp发布b10867版本,引入懒加载模式AUTO,并在AUTO模式下禁用iGPU的懒张量加载,以修复集成显卡回归问题。
AI解读:在llama.cpp中,懒张量加载是一种按需加载模型权重的方式,可减少启动内存占用,但它在集成显卡(iGPU)上引发了回归问题——可能表现为性能下降或不稳定。本次b10867版本新增了懒加载模式AUTO,并默认在iGPU上关闭懒张量加载,从根源上解决这一回归。对于使用集成显卡(如Intel核显)运行llama.cpp的用户,这个版本的默认行为会回归到更保守的加载方式,意味着启动时占用的内存可能增大,但换取的是性能和稳定性提升。如果你是开发者,可以在AUTO模式下手动控制是否启用懒加载,但需要在iGPU上做更多测试来权衡。对于普通用户,如果当前版本使用正常,则无需立即升级,因为此版本主要面向修复。
llama.cpp发布b10867版本,默认在集成显卡(iGPU)上禁用懒张量加载,以修复此前引入的iGPU回归问题。该版本同时新增懒加载模式AUTO。
修复内容
版本说明中显示,本次修改基于拉取请求 #28326,内容包括:为懒加载增加AUTO模式,并修复iGPU回归。具体实现为回滚部分改动,仅保留在AUTO模式下禁用iGPU的懒加载。
- 在iGPU上默认关闭懒张量加载
- 新增懒加载模式AUTO
- 修复了iGPU回归问题
平台与构建说明
该版本提供多平台预编译二进制包,包括macOS(Apple Silicon与Intel)、iOS、Linux(Ubuntu多种架构与后端)、Android、Windows以及openEuler。
- macOS Apple Silicon (arm64) 的KleidiAI构建被禁用(关联 #23780)
- openEuler构建被禁用(关联 #23705),但页面仍列出openEuler x86 310p、910b ACL Graph以及aarch64 310p、910b ACL Graph。
- Windows arm64 CUDA 13构建标记为预览版