llama.cpp b10780发布:SYCL后端API增强,支持设备间对等复制
新版构建提供Ubuntu、Windows、macOS、Android与iOS等平台二进制,并默认应用KleidiAI优化。
AI解读:大型语言模型的本地推理工具llama.cpp本周发布新版本b10780,核心变更是SYCL后端的API增强,新增了对等复制能力。所谓对等复制,通俗说就是让不同厂商的GPU(例如Intel与NVIDIA显卡)之间可以直接交换数据,不必先绕道CPU内存中转,跨设备跑大模型时的张量搬运延迟可以更低、路径更直接。这对使用多卡或异构GPU环境做推理部署的开发者最有用;如果你是单张显卡或只用CPU跑应用,这次更新基本不影响你,不需要立即动手。版本发布本身也只算增量改进,不是架构级变化。官方同时给出的多平台安装包列得比较全,Ubuntu、Windows、macOS、Android和iOS都能找到对应构建,且macOS上原本可选的KleidiAI优化在新版本默认启用。
llama.cpp发布b10780版本,主要内容是SYCL后端的API增强,用于支持peer-to-peer copy(对等复制)。
项目方还提供了适用于macOS、Linux、Android、Windows和iOS的预编译二进制,涵盖CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA与OpenCL等后端。
平台访问说明与下载限制
macOS Apple Silicon(arm64)版本默认启用KleidiAI优化;附带的KleidiAI专用构建在本次发布中标记为DISABLED,相关讨论见PR #23780。
Windows arm64的CUDA 13构建仍标注为preview(预览)版本,并附带了对应的CUDA 13.4 DLL。
openEuler的x86 (310p)、x86 (910b, ACL Graph)、aarch64 (310p)、aarch64 (910b, ACL Graph) 构建在本次发布中同样标记为DISABLED,相关讨论见PR #23705。
- 本次提供的平台组合包括:macOS Apple Silicon/Intel、iOS XCFramework、Ubuntu x64/arm64/s390x CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及Windows x64/arm64的多套后端。
CLI与使用参考
本次发布信息来自llama.cpp官方Release notes,汇总脚本同样可在存储库archive中获取。
关于各构建的详细用法,可参考项目维护者提供的llama.cpp入门指南与CLI参数说明(见项目Wiki)。