开源llama.cpp Releases·2026年9月5日

llama.cpp b10754发布:修复Adreno OpenCL图像内核越界读取

llama.cpp发布b10754版本,修复了Adreno图像内核中的越界读取问题,并改进KQ/KQV GEMM的调度逻辑。

AI解读:这次llama.cpp更新针对的是移动端GPU推理的稳定性。Adreno GPU常见于高通骁龙芯片,很多手机和Windows on ARM设备用它们跑本地大模型。之前的内核在读取数据时可能超出边界,轻则算错,重则崩溃。修复方式是给q4_K解码操作加上边界限制,并让KQ/KQV矩阵计算的分块逻辑在分发时就被确定,而不是运行时才根据内存布局推导。对普通用户来说,如果你在Adreno设备上跑llama.cpp(比如通过OpenCL后端),这个版本值得升级——理论上推理会更稳定,不会被随机崩溃打断。目前没有性能测试数据,所以它不会直接变快,但少出错就是少浪费算力。最直接受益的是用安卓手机或骁龙版Windows平板跑本地模型的开发者。

llama.cpp项目发布b10754版本,核心修复内容是Adreno OpenCL图像内核中的越界读取问题,涉及q4_K解码和KQ/KQV GEMM运算。

这次修复来自PR #27632,包含三项改动:在填充后的x-grid上限制q4_K解码的抓取行;强制图像KQ/KQV GEMM遵循图块划分契约;在分发时决定KQ/KQV的拆分方式,而不是依赖内存步长。

Adreno GPU主要出现在高通骁龙平台,影响范围包括Windows on ARM的OpenCL构建和部分Android设备,这些平台的本地推理稳定性是本次更新的直接收益点。

信息来源

llama.cpp Releases原始来源