开源llama.cpp Releases·2026年9月5日

llama.cpp发布b10759:修复KleidiAI调度时的缓冲区类型初始化问题

新版本默认提供macOS Apple Silicon (arm64) 构建,但启用KleidiAI的构建因相关PR被禁用;同时为Ubuntu s390x、Windows ARM64 CUDA预览版等提供实验性支持。

开源大模型推理引擎llama.cpp于发布b10759版本,主要变更是一处ggml层的修复:在KleidiAI调度时避免初始化缓冲区类型(PR #27891,由Acmmi参与贡献)。

构建与平台支持

本次发布提供多平台二进制:macOS支持Apple Silicon(arm64)和Intel(x64),并附带iOS XCFramework;Linux提供Ubuntu x64/arm64/s390x的CPU构建,以及基于Vulkan、ROCm 7.14、OpenVINO 2026.3.1、SYCL(FP32/FP16)的构建。Windows提供x64/arm64的CPU版本,以及Vulkan、OpenVINO、SYCL、ROCm 7.14、CUDA 12.4/13.3/13.4版本——其中CUDA 13.4的arm64版仍标为预览(preview)。Android提供arm64 CPU版。

  • macOS Apple Silicon (arm64) 的KleidiAI启用版被标记为DISABLED,对应PR #23780 被禁用;openEuler的构建(x86 310p、910b ACL Graph、aarch64 310p等)同样被禁用,对应PR #23705。

信息来源

llama.cpp Releases原始来源