开源llama.cpp Releases·2026年9月5日

llama.cpp b10738发布:SYCL后端限制host-pinned内存分配不超 2GB

新版为SYCL后端新增对主机固定内存单次分配上限 2GB的限制,涉及为昇腾等设备优化内存管理。

AI解读:llama.cpp这次小版本更新解决的是一个具体的兼容性问题:在SYCL后端(主要用于英特尔显卡或数据center GPU)上,当模型需要把数据从主机内存搬运到设备显存时,会用到一种叫host-pinned的锁定内存块。以前这种内存块可能一次性分配超过 2GB,在某些系统上(比如 32 位环境或某些驱动)会导致分配失败或程序崩溃。现在b10738给分配逻辑加了道闸门,单次最大不超过 2GB,需要更大空间就分多次来。对普通用户来说,如果你只是用CPU或NVIDIA GPU跑llama.cpp,这次改动基本不影响你,不用急着升级。但如果你在Linux上跑SYCL版本,或者用昇腾这类加速卡,且之前遇到过内存分配报错,可以试一下新版;由于这是底层内存策略调整,官方说明之外没有额外性能数据,不建议据此预期速度变化。

llama.cpp发布b10738版本,主要改动是在SYCL后端增加对host-pinned内存分配上限的控制,单次分配不得超过 2GB(pull #27559)。该限制针对主机固定内存,用于避免一次性分配过大。

新版本同时提供多平台预编译二进制,覆盖macOS(Apple Silicon与Intel)、iOS、Linux(Ubuntu x64/arm64/s390x,含Vulkan、ROCm 7.14、OpenVINO 2026.3.1、SYCL FP32/FP16)、Android arm64、Windows(x64/arm64,含CUDA 12.4/13.3/13.4、Vulkan、OpenVINO、SYCL、ROCm 7.14)以及openEuler。

部分构建因上游问题被标记为DISABLED:macOS Apple Silicon的KleidiAI版本(关联pull #23780)和openEuler x86/aarch64的 310p与 910b (ACL Graph) 构建(关联pull #23705)未随本版提供。

项目同时提供独立的UI包(llama-b10738-ui.tar.gz)和CUDA运行时DLL(12.4、13.3、13.4),Windows arm64的CUDA 13.4构建标注为preview。

信息来源

llama.cpp Releases原始来源