llama.cpp b10826发布:修复CUDA后端mmid与mmf中的竞态条件
新版本主要针对CUDA后端的多模态推理(如mmid、mmf)进行并发修复,并同步更新各平台预编译二进制文件。
AI解读:llama.cpp的这次更新主要面向在NVIDIA GPU上运行多模态模型的用户。所谓“修复竞态条件”,指的是当多个计算任务(比如同时处理图像和文本)在GPU上并行执行时,可能因资源竞争导致结果出错或程序崩溃。本次更新修复了这个问题,意味着使用CUDA后端的用户在进行图像/视频理解等任务时会更加稳定。如果你是普通桌面用户,暂不需要立即行动;如果你是自部署推理服务的开发者,建议在测试环境中验证后升级到b10826,以规避潜在的并发错误。需要留意的是,macOS上支持KleidiAI加速的版本暂未启用,而Windows arm64的CUDA 13版本仍标记为预览,生产环境应谨慎使用。
llama.cpp项目发布b10826版本,核心变更为“cuda: fixes races in mmid and mmf”(#28475),修复CUDA后端在多模态推理路径mmid与mmf中存在的竞态条件问题。
该项目同步为多个平台提供预编译二进制文件,涵盖macOS(Apple Silicon、Intel)、iOS、Linux(Ubuntu x64/arm64/s390x)、Android(arm64)以及Windows(x64/arm64的多后端版本)。
修复内容与平台支持
根据发布说明,本次更新针对CUDA后端的mmid和mmf代码路径中的竞态条件(race conditions)进行了修复,涉及多模态模型推理时的并发一致性问题。
不同平台的预编译包支持以下后端与架构:Ubuntu提供CPU(x64、arm64、s390x)、Vulkan(x64、arm64)、ROCm 10.0(x64)、OpenVINO(x64)及SYCL FP32/FP16(x64);Windows提供CPU(x64、arm64)、CUDA 12.4(x64)、CUDA 13.3(x64)、CUDA 13.4(arm64,预览)、Vulkan(x64)、OpenVINO(x64)、SYCL(x64)及ROCm 10.0(x64)。
部分平台构建暂被禁用:macOS Apple Silicon的KleidiAI加速版本未启用(见PR #23780),openEuler相关构建也未提供(见PR #23705)。
该版本还附带独立的UI组件包(llama-b10826-ui.tar.gz),以及适用于Windows CUDA 12.4、13.3、13.4 的DLL文件包,供开发者集成使用。
- macOS:Apple Silicon (arm64)、Intel (x64) 版本可用;KleidiAI加速版本未启用。
- Windows:arm64的CUDA 13版本标记为“preview”。
- Linux:Ubuntu支持OpenVINO 2026.3.1版本。