开源llama.cpp Releases·原文 2026年9月7日

llama.cpp发布b10830:新增 --fuse-qkv参数,转换时合并Q/K/V矩阵

llama.cpp发布b10830版本,核心变化是在HF到GGUF转换工具中新增 --fuse-qkv参数,可在模型转换阶段将查询、键、值矩阵融合为QKV。各平台安装包同步发布。

AI解读:llama.cpp在b10830版本中为模型转换工具新增了 --fuse-qkv参数,这个开关的作用是在把Hugging Face格式的模型转成GGUF时,就把每个注意力层的Q、K、V三个矩阵合并成一个QKV矩阵。对普通用户来说,它主要带来两方面的实际影响:一是转换时就能完成融合,省去后续运行时重复做矩阵拼接的开销,推理时可能更省内存和计算;二是让量化和部署阶段看到的结构更接近底层算子习惯。需要说明的是,这个参数只对转换环节有用,不会改变模型本身的精度,效果取决于具体模型的架构。如果你平时只是用现成的GGUF文件,这次更新不需要你手动做什么,但如果你自己转换模型,可以在转换命令里加上 --fuse-qkv试试,融合后模型能不能正常加载和推理以实测为准。

llama.cpp于b10830版本为HF到GGUF的模型转换工具添加 --fuse-qkv参数,用于在转换阶段将注意力层的Q、K、V矩阵融合为QKV矩阵(PR #22780)。该版本同时发布了各平台预编译二进制。

信息来源

llama.cpp Releases原始来源