llama.cpp b10868发布:为MoE模型添加IQ量化类型处理支持
新增PR #28476,为专家混合(MoE)架构添加IQ量化类型的处理逻辑;同时发布多平台预编译二进制文件。
AI解读:这次发布解决了MoE模型在使用IQ系列量化格式时的兼容问题。IQ量化是对模型权重做低比特压缩,能减少内存占用,但此前在专家混合(MoE)架构中可能处理不当,导致模型无法加载或推理结果错误。llama.cpp b10868通过PR #28476 补上了IQ类型的处理分支,使得像Mixtral、Qwen2-MoE这类模型的IQ量化版可以在llama.cpp上正常运行。
这对本地部署者来说意味着更多模型选择,且内存占用更低;如果你已经在用IQ量化的MoE模型,更新到这个版本即可获得修复,不需要额外操作。需要注意的是,本次更新没有附带专门的性能数据,实际效果取决于具体模型和硬件。
llama.cpp发布b10868版本。主要变更为PR #28476“Add IQ type handling for MoE”,由cwriter共同编写,为混合专家(MoE)模型增加对IQ量化类型的处理逻辑。
平台构建与可用性
新版本提供了面向多平台、多后端的预编译二进制包。macOS提供Apple Silicon (arm64) 与Intel (x64) 版本;Linux提供Ubuntu x64/arm64/s390x CPU版,以及Vulkan、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16版;Windows提供CPU (x64/arm64)、CUDA 12.4与 13.3、CUDA 13.4 arm64(预览)、Vulkan、OpenVINO、SYCL、ROCm 10.0版本;另有OpenCL Adreno (Windows arm64) 版本。Android提供arm64 CPU包,iOS提供XCFramework。
- macOS Apple Silicon的KleidiAI启用版本继续标记为禁用,对应PR #23780。
- openEuler相关构建同样标记为禁用,对应PR #23705。
- 下载链接均为GitHub Releases页面提供的二进制压缩包。