开源llama.cpp Releases·2026年9月5日

llama.cpp b10816发布,为Apple M3补齐Metal上剩余量化类型的快速向量调优

本次更新将M3加入Metal快速向量(fa-vec)调优表,并为其新增q4_0、q4_1、q5_0、q5_1四种量化类型的调优,可望提升M3芯片上的推理速度。

AI解读:本次发布针对使用Apple M3芯片、在macOS上通过Metal后端运行llama.cpp的用户。此前快速向量调优(fa-vec)只覆盖部分芯片或量化格式,导致M3在低比特量化(如q4_0、q4_1)下无法充分利用Metal的向量指令,推理速度受限。b10816将M3加入调优表并补齐q4_0、q4_1、q5_0、q5_1四种格式,相当于为这些常见量化配置开启更底层的性能优化。实际提速取决于具体模型和上下文长度,需要用户自行测试对比;KleidiAI构建仍处于禁用状态,相关支持见PR #23780。

llama.cpp发布b10816版本,主要内容是为Apple M3芯片补齐Metal后端剩余量化类型的快速向量(fa-vec)调优。

该版本将M3加入fa_vec_tuned_table,并在ggml-metal-tuning中为M3添加q4_0、q4_1、q5_0、q5_1四种量化类型的调优,同时修复了ggml-metal-tuning.cpp中的格式问题。

发布同时提供了macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64 CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16、s390x)、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm 10.0、OpenCL Adreno)、Android arm64 CPU等多种预编译二进制包。

值得注意的是,本次macOS Apple Silicon(arm64)的KleidiAI版本标注为DISABLED,相关支持正在PR #23780 中讨论。

信息来源

llama.cpp Releases原始来源