开源llama.cpp Releases·原文 2026年9月9日

llama.cpp b10871发布:为RDNA4显卡新增Vulkan专用iq4_xs矩阵-向量着色器

新版为dmmv路径加入专用mul_mat_vec_iq4_xs着色器,取代通用回退逻辑,据称可在RDNA4上带来约 6% 到 17% 的token生成速度提升,具体取决于模型。

llama.cpp发布b10871版本,为Vulkan后端新增了专用于iq4_xs量化的矩阵-向量乘法着色器(mul_mat_vec_iq4_xs),用于dmmv(dequantize-multiply-matrix-vector)路径,替代此前使用的通用回退实现。据release说明,该改动在RDNA4显卡上可带来约 6% 至 17% 的token生成速度提升,具体数值取决于模型。

shader细节与辅助工具

本次提交(PR #28426)实现了专门的mul_mat_vec_iq4_xs着色器,并移除了n_it展开分支中的死代码。此外,贡献说明提到该工作由“Pi agent with Qwen3.8 27B”提供辅助,这表明开发者使用了AI工具进行编码协助,但核心功能仍针对Vulkan的dmmv路径优化。

信息来源

llama.cpp Releases原始来源