开源llama.cpp Releases·原文 2026年9月9日

llama.cpp b10870发布:Vulkan后端新增f16 B型矩阵乘法管线

该版本为Vulkan后端引入f16 B型矩阵乘法管线,并针对Intel coopmat1调整warp tile大小;密集矩阵乘法在所有厂商GPU上启用,MoE仍限于Intel。

llama.cpp发布b10870版本,主要更新Vulkan后端:新增f16 B-type矩阵乘法(matmul)管线,并为Intel coopmat1硬件添加warp tile大小调整支持。

更新内容与硬件支持

本次更新(PR #27471)为Vulkan后端增加了f16 B-type matmul管线,并针对Intel coopmat1进行warp tile大小调节。密集矩阵乘法(dense matmul)的f16 B-type管线已在所有厂商(Vulkan支持)上启用,但混合专家模型(MoE)的该管线仍仅限Intel使用。

此外,更新还补充了缺失的ocp_fp4分支,将required_subgroup_size限制为Intel(仅Intel需要),并改进了mul_mat_id和dense函数中管线的选择逻辑。

版本发布与构建状态

macOS与Linux提供CPU、Vulkan等多种后端构建;Windows提供CPU、CUDA 12/13、Vulkan、OpenVINO等变体;另有Android、iOS及UI包。

部分构建被禁用:macOS Apple Silicon的KleidiAI版本(PR #23780)以及openEuler相关构建(PR #23705)当前不可用,官方未说明具体原因。

信息来源

llama.cpp Releases原始来源