开源llama.cpp Releases·2026年9月5日

llama.cpp b10756发布:Vulkan后端仅在支持时请求BF16扩展

llama.cpp b10756发布,改进Vulkan后端对bfloat16扩展的兼容性处理,并更新多平台二进制包,涉及macOS、Linux、Windows、Android和iOS。

AI解读:这个版本的核心变化是让Vulkan后端在请求VK_KHR_shader_bfloat16扩展前先检查驱动是否支持,避免在不支持的设备上因强行启用而报错或崩溃。对普通用户来说,如果你用支持Vulkan的GPU(尤其是AMD或Intel显卡)跑大模型,更新后可能减少启动失败的情况,但对不支持BF16的旧设备,性能不会有变化。至于其他修复或性能提升,这个发布说明没有给出具体数据,所以别指望版本号改变会带来奇迹。如果你在用旧版且Vulkan推理正常,不急着升级;若遇到Vulkan相关报错,可以试试这个版本。下载完整二进制包可从GitHub Releases页面获取。

llama.cpp项目发布b10756版本,改动集中在Vulkan后端:仅在设备支持时请求VK_KHR_shader_bfloat16扩展(提交 #28155),以避免在不支持该扩展的硬件上出错。

Vulkan改进

本次发布包含一项变更:Vulkan后端现在会检查并仅当设备支持VK_KHR_shader_bfloat16扩展时才请求该扩展。这避免了在不支持的Vulkan驱动上因请求该扩展而导致初始化或运行失败。

构建与下载

b10756提供了多个平台的预编译二进制包,覆盖macOS(Apple Silicon arm64和Intel x64)、iOS(XCFramework)、Linux(Ubuntu x64/arm64/s390x CPU、Vulkan、ROCm 7.14、OpenVINO 2026.3.1、SYCL FP32/FP16)、Android(arm64 CPU)、Windows(x64/arm64 CPU、OpenCL Adreno、CUDA 12.4/13.3/13.4、Vulkan、OpenVINO、SYCL、ROCm 7.14),以及独立UI包。

部分构建被标记为禁用:macOS Apple Silicon的KleidiAI版本(关联PR #23780)和openEuler构建(关联PR #23705)。Windows arm64 CUDA 13版本标记为预览版。

信息来源

llama.cpp Releases原始来源