llama.cpp b10870发布:Vulkan后端新增f16 B型矩阵乘法管线
该版本为Vulkan后端引入f16 B型矩阵乘法管线,并针对Intel coopmat1调整warp tile大小;密集矩阵乘法在所有厂商GPU上启用,MoE仍限于Intel。
llama.cpp发布b10870版本,主要更新Vulkan后端:新增f16 B-type矩阵乘法(matmul)管线,并为Intel coopmat1硬件添加warp tile大小调整支持。
更新内容与硬件支持
本次更新(PR #27471)为Vulkan后端增加了f16 B-type matmul管线,并针对Intel coopmat1进行warp tile大小调节。密集矩阵乘法(dense matmul)的f16 B-type管线已在所有厂商(Vulkan支持)上启用,但混合专家模型(MoE)的该管线仍仅限Intel使用。
此外,更新还补充了缺失的ocp_fp4分支,将required_subgroup_size限制为Intel(仅Intel需要),并改进了mul_mat_id和dense函数中管线的选择逻辑。
版本发布与构建状态
macOS与Linux提供CPU、Vulkan等多种后端构建;Windows提供CPU、CUDA 12/13、Vulkan、OpenVINO等变体;另有Android、iOS及UI包。
部分构建被禁用:macOS Apple Silicon的KleidiAI版本(PR #23780)以及openEuler相关构建(PR #23705)当前不可用,官方未说明具体原因。