llama.cpp b10833:Vulkan后端融合RMS_NORM操作,Gemma系模型性能提升约 4%
llama.cpp发布b10833,为Vulkan后端新增RMS_NORM与MUL、ADD、VIEW、SET_ROWS等操作的融合支持,并扩展ROPE对IMROPE的支持,作者称在其系统上Gemma模型性能提升约 4%。
AI解读:llama.cpp的本次更新瞄准了Vulkan后端的推理效率。开发者把RMS_NORM与后续的MUL、ADD等操作合并成单一内核,减少了多次读写显存的中间环节,同时让ROPE旋转位置编码支持IMROPE。对应到实际效果,PR作者(github-actions[bot] 代发)称在自己系统上Gemma模型约有 4% 的性能提升。对在AMD、Intel显卡或移动设备上通过Vulkan跑本地大模型的用户来说,这意味着同样的硬件能获得略微更低的延迟或更高的吞吐,且无需改动模型文件。不过这一优化仅对启用Vulkan后端且模型结构中包含上述算子组合的场景生效;CPU、CUDA等其他后端不受影响。普通用户无需立即操作,直接下载对应平台的b10833二进制即可,速度提升幅度因硬件和模型而异,4% 是作者单机测试结果,不代表所有环境。
llama.cpp发布b10833版本,主要为Vulkan后端增加算子融合优化:支持RMS_NORM + MUL + ADD(+ MUL)以及RMS_NORM + VIEW + SET_ROWS的组合,并将ROPE + VIEW + SET_ROWS扩展为支持IMROPE。提交者称该改动在其系统上为Gemma模型带来约 4% 的性能提升。