开源llama.cpp Releases·2026年9月5日

llama.cpp b10723发布:针对Intel Xe-LP GPU优化量化路径,提升生成与预填充性能

新版本改进了OpenCL后端在Intel Xe-LP显卡上的Q4_K/Q5_K量化矩阵运算,通过调整tile和N_DST参数带来性能提升。

AI解读:llama.cpp这次更新专门针对Intel Xe-LP核显(常见于轻薄本和移动设备)优化了OpenCL量化路径。此前,在Intel GPU上跑 4-bit或 5-bit量化模型时,矩阵乘法的并行度设置不理想,导致token生成(TG)和预填充(PP)速度偏慢。这次通过把Q4_K/Q5_K的mul_mv操作N_DST从 4 提到 8(Q4_K后续再提到 16)、并为mul_mm启用 8x8 tile,让激活值能复用两次,显存带宽利用更充分。实际效果是:如果你用Intel Xe-LP核显跑llama.cpp,生成速度和处理提示词的速度会有提升。普通用户如果不用这种GPU或只跑CPU,本次更新没有影响;相关用户直接拉取新版本二进制或源码重新编译即可。注意,这只是软件层面的调优,不改变模型质量或兼容性,具体提速幅度没有公布基准数字。

llama.cpp发布b10723版本,主要工作是为OpenCL后端在Intel Xe-LP GPU上的量化路径调优,目标是改善token生成(TG)和预填充(PP)性能。改动来自PR #26438。

针对Intel Xe-LP的OpenCL量化路径调整

此次更新包含四项具体改动,全部针对Intel GPU的OpenCL实现:将Q4_K/Q5_K的mul_mv操作N_DST参数从 4 提高到 8,以支持 2 倍激活复用;为Intel的Q4_K mul_mm启用 8x8 tile;为Intel的Q5_K mul_mm启用 8x8 tile;将Intel的Q4_K mul_mv N_DST参数从 8 进一步调整为 16。

信息来源

llama.cpp Releases原始来源