llama.cpp b10758发布:Hexagon后端融合QKV/FFN矩阵乘法并修复
新版聚焦Qualcomm Hexagon后端:将落在HMX上的QKV与FFN matmul融合,并移除硬编码的ne[1];同步提供多平台二进制。
AI解读:llama.cpp这次b10758更新的核心是给Qualcomm Hexagon(骁龙等平台上的AI加速器)后端提速:把QKV和FFN里原本分开计算的矩阵乘法融合到一起,直接在HMX上执行,同时删掉了硬编码的维度限制,让代码可以适配更多形状。对在Android、Windows ARM等设备上用llama.cpp跑大模型的开发者来说,这意味着Hexagon上的推理可能更快、更通用,但注意这些改动只在特定硬件和驱动支持时才生效。作为参考,社区合并这一PR后,相应平台用户可以直接下载官方二进制测试验证;如果你不在这些设备上部署,这次更新不需要立即采取行动。
llama.cpp发布b10758版本,主要内容是Qualcomm Hexagon后端的融合与修复(PR #28202)。
该PR将落在HMX单元上的QKV与FFN矩阵乘法(matmul)进行融合,并移除了代码中硬编码的ne[1] 维度限制。
版本同时提供macOS、Linux、Windows、Android、iOS等平台的预编译二进制,覆盖CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL、OpenCL(Adreno)等后端。