llama.cpp b10790发布:调整SM87架构的MMVQ与MMQ切换阈值
新版本唯一变更针对SM87(推测为NVIDIA Blackwell架构)内核,调整了矩阵乘法向量量化(MMVQ)与矩阵乘法量化(MMQ)之间的交叉切换条件,未涉及其他功能更新。
llama.cpp发布b10790版本,唯一代码变更为“tune MMVQ to MMQ crossover for SM87”(针对SM87调整MMVQ到MMQ的交叉切换),PR编号 #28285。该版本未改动其他功能,仅优化特定硬件架构上的量化矩阵乘法路径选择。
变更内容与适用范围
本次更新针对SM87架构,调整了两种量化矩阵乘法实现之间的切换条件:MMVQ(矩阵乘法向量量化)和MMQ(矩阵乘法量化)。变更目的是微调切换点,使SM87在不同量化参数下自动选择更合适的内核路径。
SM87对应NVIDIA Blackwell架构的消费级GPU(如RTX 50系列)。此次优化不影响其他CUDA架构(如Ampere、Ada Lovelace)或非NVIDIA后端。
- 唯一代码变更:PR #28285,调整SM87的MMVQ/MMQ交叉切换。
- 涉及架构:SM87(Blackwell消费级)。
- 预期效果:改善特定量化矩阵乘法的执行路径选择,可能小幅提升推理性能。
发布资产与构建状态
b10790为各主流平台提供了预编译二进制和源码包。macOS提供Apple Silicon(arm64)和Intel(x64)版本,其中Apple Silicon的KleidiAI加速版本标记为DISABLED(对应PR #23780)。
Linux提供Ubuntu的x64、arm64、s390x CPU版,以及x64/arm64的Vulkan版、x64的ROCm 10.0版、OpenVINO版和SYCL(FP16/FP32)版。Android提供arm64 CPU版。
Windows提供x64和arm64 CPU版,arm64另有OpenCL Adreno版;CUDA版覆盖 12.4 和 13.3(x64)、13.4(arm64,标注preview);此外有x64的Vulkan、OpenVINO、SYCL、ROCm 10.0版。openEuler构建标记为DISABLED(PR #23705)。
项目还发布了一个UI压缩包(llama-b10790-ui.tar.gz),但未随版本说明提供详细更新日志。
- 平台支持:macOS、Linux、Windows、Android。
- 后端覆盖:CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL、OpenCL。
- 两个构建被禁用:macOS Apple Silicon KleidiAI、openEuler(具体原因见关联PR)。