llama.cpp b10881发布:修复Intel GPU运行Qwen3时Vulkan FILL越限问题
新版本将FILL工作负载改为二维分布,解决Intel显卡在运行Qwen3时因超出Vulkan工作组数量上限导致的报错,并同步更新多平台二进制。
AI解读:llama.cpp更新到b10881,唯一代码改动是把Vulkan的FILL操作从一维工作组分发改成二维。起因是Intel显卡在跑Qwen3时,FILL需要的工作组数量超过硬件上限maxComputeWorkGroupCount,直接崩掉或报错。
这个问题只影响Vulkan后端的Intel GPU用户,NVIDIA、AMD一般不受影响。如果你用llama.cpp在Intel核显或显卡上跑Qwen3模型,升级这个版本就能绕开限制,不用改模型或降低精度。
对大多数人来说这是个小修的日常版:没加新功能、没提速,就是修补一条特定硬件的路径。用官方预编译包的用户直接下载对应平台文件替换即可,自己编译的拉源码重编一次就能生效。
llama.cpp发布b10881版本,正式修复Vulkan后端下FILL操作因超出maxComputeWorkGroupCount限制而在Intel GPU上失败的问题。
官方release说明显示,这次改动将FILL的工作负载转换为二维workgroup分布,旨在规避Intel显卡在运行Qwen3时因工作组数量超限导致的错误。
技术修复与适用条件
本次改动来自pull request #28592,解决核心问题是在Vulkan后端,当FILL操作尝试分配超过设备maxComputeWorkGroupCount上限的工作组时,会在Intel GPU上触发错误。
此问题在运行Qwen3时被复现。通过将工作负载改为二维分布,可以绕过一维工作组数量的硬件限制。
- 涉及平台:Intel GPU,且使用Vulkan后端
- 相关模型:Qwen3(如Qwen 3.8 flash)
- 无其他代码变更说明;macOS KleidiAI版本仍标记为禁用状态(见PR #23780)
发行渠道与平台支持
b10881提供了覆盖macOS、Linux、Windows、Android及iOS的多平台预编译包。
macOS提供Apple Silicon(arm64)、Intel(x64)及iOS XCFramework版本;Linux提供Ubuntu x64/arm64/s390x CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL等后端;Windows提供CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm版本,以及arm64 CPU和OpenCL Adreno版本。
openEuler平台构建被禁用,原因参考PR #23705。
- Android仅有arm64 CPU版
- Windows提供CUDA 12.4与 13.3 运行库zip
- 附带UI包,供需要界面的用户使用