开源llama.cpp Releases·2026年9月5日

llama.cpp b10729发布:为M1 Ultra新增Metal fa-vec调优

新版本通过PR #28088 为M1 Ultra加入Metal后端fa-vec(flash attention向量化)调优,并调整了代码段位置以优化性能;同时提供面向macOS、Linux、Windows、Android等多个平台的预编译二进制。

AI解读:这次llama.cpp更新针对的是Apple M1 Ultra芯片上的Metal推理性能。开发者通过PR #28088 为M1 Ultra添加了fa-vec(flash attention向量化)调优,目的是让这款芯片在运行大模型时更快地完成注意力计算——这是Transformer模型中最耗算力的部分之一。对M1 Ultra用户(比如Mac Studio用户)来说,这意味着本地跑模型可能获得更低的延迟和更流畅的响应,但注意调优只影响特定硬件,且目前没有给出具体提速百分比,实际提升要自行跑基准测试验证。对普通用户,这只是一次例行维护,除非你正好在用M1 Ultra跑llama.cpp,否则不需要特别关注;对开发者和自部署者,建议更新到b10729并留意fa-vec相关选项是否默认启用或需手动开启。

llama.cpp发布b10729版本更新,核心改动是为Apple M1 Ultra芯片添加Metal后端的fa-vec(flash attention向量化)调优,相关代码来自PR #28088。

该PR包含三项提交:新增M1 Ultra的fa-vec调优、将M1 Ultra调优代码移到M1 Max部分之后、删除多余空行。

平台支持与二进制下载

随版本提供多种预编译二进制,覆盖macOS、Linux、Windows、Android等平台。macOS提供Apple Silicon(arm64)和Intel(x64)版本,以及iOS XCFramework;macOS Apple Silicon的KleidiAI启用版本被标记为DISABLED,对应PR #23780。

Linux提供Ubuntu x64/arm64/s390x CPU版本、x64/arm64 Vulkan版本、x64 ROCm 7.14版本、x64 OpenVINO 2026.3.1版本,以及x64 SYCL FP32/FP16版本。Windows提供x64 CPU、arm64 CPU、arm64 OpenCL Adreno、x64 CUDA 12.4/13.3、x64 Vulkan、x64 OpenVINO 2026.3.1、x64 SYCL、x64 ROCm 7.14等版本,另含Windows arm64 CUDA 13.4预览版。

  • Android提供arm64 CPU版本。
  • openEuler平台相关的构建被标记为DISABLED(对应PR #23705),包括x86(310p)、x86(910b, ACL Graph)、aarch64(310p)和aarch64(910b, ACL Graph)。
  • 此外提供UI组件包(llama-b10729-ui.tar.gz)。

信息来源

llama.cpp Releases原始来源