开源llama.cpp Releases·原文 2026年9月9日本站收录 2026年9月10日

llama.cpp b10881发布:修复Intel GPU运行Qwen3时Vulkan FILL越限问题

新版本将FILL工作负载改为二维分布,解决Intel显卡在运行Qwen3时因超出Vulkan工作组数量上限导致的报错,并同步更新多平台二进制。

AI解读:llama.cpp更新到b10881,唯一代码改动是把Vulkan的FILL操作从一维工作组分发改成二维。起因是Intel显卡在跑Qwen3时,FILL需要的工作组数量超过硬件上限maxComputeWorkGroupCount,直接崩掉或报错。

这个问题只影响Vulkan后端的Intel GPU用户,NVIDIA、AMD一般不受影响。如果你用llama.cpp在Intel核显或显卡上跑Qwen3模型,升级这个版本就能绕开限制,不用改模型或降低精度。

对大多数人来说这是个小修的日常版:没加新功能、没提速,就是修补一条特定硬件的路径。用官方预编译包的用户直接下载对应平台文件替换即可,自己编译的拉源码重编一次就能生效。

llama.cpp发布b10881版本,正式修复Vulkan后端下FILL操作因超出maxComputeWorkGroupCount限制而在Intel GPU上失败的问题。

官方release说明显示,这次改动将FILL的工作负载转换为二维workgroup分布,旨在规避Intel显卡在运行Qwen3时因工作组数量超限导致的错误。

技术修复与适用条件

本次改动来自pull request #28592,解决核心问题是在Vulkan后端,当FILL操作尝试分配超过设备maxComputeWorkGroupCount上限的工作组时,会在Intel GPU上触发错误。

此问题在运行Qwen3时被复现。通过将工作负载改为二维分布,可以绕过一维工作组数量的硬件限制。

  • 涉及平台:Intel GPU,且使用Vulkan后端
  • 相关模型:Qwen3(如Qwen 3.8 flash)
  • 无其他代码变更说明;macOS KleidiAI版本仍标记为禁用状态(见PR #23780)

发行渠道与平台支持

b10881提供了覆盖macOS、Linux、Windows、Android及iOS的多平台预编译包。

macOS提供Apple Silicon(arm64)、Intel(x64)及iOS XCFramework版本;Linux提供Ubuntu x64/arm64/s390x CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL等后端;Windows提供CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm版本,以及arm64 CPU和OpenCL Adreno版本。

openEuler平台构建被禁用,原因参考PR #23705。

  • Android仅有arm64 CPU版
  • Windows提供CUDA 12.4与 13.3 运行库zip
  • 附带UI包,供需要界面的用户使用

信息来源

llama.cpp Releases原始来源