开源llama.cpp Releases·2026年9月5日

llama.cpp发布b10770:为Apple M3芯片加入Metal fa-vec调优

新版本主要面向macOS/iOS,在Metal后端为M3芯片添加fa-vec优化,并同步提供各平台二进制包。

AI解读:llama.cpp的这次更新专门为Apple M3芯片的Metal后端添加了fa-vec调优。fa-vec是FlashAttention的向量化实现,针对M3的GPU架构做优化,目的是让模型推理更快。对普通用户来说,如果你在用M3芯片的Mac跑本地大模型,这个版本可能带来速度提升,但具体能快多少官方没有给出数据,需要自己测。值得注意的是,KleidiAI支持的macOS构建仍然禁用,如果你依赖那个特性,得继续等。除此之外没有其他功能变化,所以没必要为了追新而升级,除非你主要用M3跑推理并想试试性能差异。

llama.cpp项目发布b10770版本,主要变化是为Apple M3芯片的Metal后端添加fa-vec调优(pull request #28236)。

发布内容

本次发布以macOS/iOS平台为重点,改动集中在Metal后端的FlashAttention向量化(fa-vec)调优,目标是提升M3芯片上的推理性能。

该版本仅包含上述一项功能更新(由GitHub Actions自动发布),未提及其他修复或新特性。

  • macOS Apple Silicon (arm64) 提供常规构建;KleidiAI启用的arm64构建仍处于禁用状态(关联pull request #23780)。
  • 提供macOS Intel (x64) 与iOS XCFramework包。
  • Linux支持Ubuntu x64/arm64/s390x的CPU版本,以及Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16等后端。
  • Windows提供CPU(x64/arm64)、OpenCL Adreno(arm64)、CUDA 12.4/13.3/13.4(含预览版),以及Vulkan、OpenVINO、SYCL、ROCm 10.0包。
  • Android仅有arm64 CPU包。
  • openEuler平台的x86(310p)、x86(910b, ACL Graph)、aarch64(310p)和aarch64(910b, ACL Graph)构建被标记为DISABLED(关联pull request #23705)。

信息来源

llama.cpp Releases原始来源