开源llama.cpp Releases·2026年9月5日

llama.cpp b10727发布:Metal后端新增量化类型concat支持

本次更新为Apple Metal后端加入量化类型的连接(concat)操作支持,并补充了各平台预编译二进制。

AI解读:llama.cpp是一个在本地运行大语言模型的开源推理引擎。本次b10727版本为Apple设备上的Metal后端增加了对量化类型拼接(concat)操作的支持。此前在Metal上拼接两个量化后的张量(比如把多个层的权重拼接起来)缺少专门的底层实现,可能回退到非量化路径或不被支持,影响效率。这次合入的PR #28116 直接补齐了这个缺口。对使用Apple Silicon Mac或iPhone、iPad跑量化模型的人来说,涉及张量拼接的模型结构或工具链(例如某些MoE混合专家模型的加载、或对模型分段重组再推理)在本地执行时会更顺畅。注意macOS的KleidiAI加速版本和部分openEuler构建在本次发布中被标记为DISABLED,需要这些特性的用户应留意相关PR的进展。普通用户如果只跑常见单模型推理,不一定要立刻升级,按自己当前版本是否用得上Metal concat来决定即可。

llama.cpp发布b10727版本,核心改动是为Metal后端添加量化类型的concat(连接)支持,合并自拉取请求 #28116,提交说明标注了“Assisted-by: pi:llama.cpp/DeepSeek-V4-Flash-0731”。

量化类型concat支持

拉取请求 #28116 标题为“metal : add concat support for quantized types”,即针对Apple Metal后端,实现对量化张量类型执行concat运算的支持。此前量化类型在Metal上的concat操作可能不受支持或缺乏底层实现。

下载与构建状态

b10727提供了多平台构建产物,涵盖macOS、iOS、Linux、Android、Windows及openEuler。

macOS提供Apple Silicon (arm64) 和Intel (x64) 版本;Apple Silicon的KleidiAI加速版本在本次发布中被标记为DISABLED,关联PR #23780。

Linux提供Ubuntu x64/arm64/s390x的CPU版本,以及Vulkan、ROCm 7.14、OpenVINO 2026.3.1、SYCL FP32/FP16等后端版本。

Android提供arm64 CPU版本。

Windows提供x64/arm64 CPU、arm64 OpenCL Adreno、CUDA 12.4与CUDA 13.3的x64版本、CUDA 13.4的arm64预览版、Vulkan、OpenVINO 2026.3.1、SYCL和ROCm 7.14版本。

openEuler的x86/aarch64 310p与 910b (ACL Graph) 构建在本次发布中被标记为DISABLED,关联PR #23705。

发布还附带了UI构建包(llama-b10727-ui.tar.gz)。

信息来源

llama.cpp Releases原始来源