开源llama.cpp Releases·2026年9月5日

llama.cpp发布b10739:为M2 Max添加fa-vec调优数据

新版本通过 'ggml-metal-tuning fa-vec' 采集的M2 Max(30 GPU核心)数据优化Metal后端向量查找性能,并同步提供多平台二进制包。

AI解读:这次llama.cpp更新针对的是Apple M2 Max芯片的本地推理性能。开发团队用内置的ggml-metal-tuning工具在f16和q8_0两种精度下采集了M2 Max(30 个GPU核心)的fa-vec调优参数行,并直接写入代码,让Metal后端能选出更合适的向量运算配置。对使用M2 Max Mac运行GGUF量化模型的人来说,这通常意味着更快的推理速度或更低的延迟。需要提醒的是,目前没有公开的基准测试数据说明提升幅度有多大,所以不必急着升级,除非你确实用这类硬件跑本地模型;不过因为这是开源项目,改动已合并进主线,拉取最新代码的人会自动获得这套调优,无需额外操作。

llama.cpp于 2 月 4 日发布b10739版本,主要包含一项针对Apple M2 Max芯片的Metal后端优化:通过新增的调优命令 'ggml-metal-tuning fa-vec' 收集了M2 Max(30 GPU核心)在f16和q8_0精度下的fa-vec调优数据行,并将结果写入fa_vec_tuned_table。该改动由PR #28015 合并,AI工具辅助标注为 'pi:llama.cpp/Qwen3.8-27B'。

此次发布仅包含上述一个主要代码改动,未提及其他功能更新或修复。

发布详情与支持平台

b10739为GitHub上的正式release版本,随附适用于macOS、Linux、Windows、Android和iOS的预编译二进制包。下载链接包括:macOS Apple Silicon (arm64) 与Intel (x64)、iOS XCFramework、Ubuntu x64/arm64/s390x(CPU)、Ubuntu x64/arm64(Vulkan)、Ubuntu x64(ROCm 7.14)、Ubuntu x64(OpenVINO)、Ubuntu x64(SYCL FP32/FP16)、Android arm64 (CPU)、Windows x64/arm64(CPU)以及Windows x64(CUDA 12.4/13.3)等。

公告同时标注了部分平台构建状态:macOS Apple Silicon的KleidiAI版本被禁用(对应PR #23780),openEuler平台的构建被禁用(对应PR #23705)。

信息来源

llama.cpp Releases原始来源