开源llama.cpp Releases·2026年9月5日

llama.cpp b10731为Qwen4实验模型加入循环状态回滚,修复MTP投机解码性能回退

新版本为Qwen4实验分支增加循环状态回滚支持,修复MTP投机解码因整状态序列化到主机内存导致的性能损失;实测代码解码达 183 tok/s,散文达 144 tok/s。

llama.cpp发布b10731版本,为Qwen4实验模型(qwen4exp)新增循环状态回滚支持。此前Qwen4的MTP投机解码因缺少回滚能力,服务器被迫在每个解码轮次将整个循环状态序列化到主机内存,开销超过投机解码节省的计算。

本次改动让每个时隙(slot)都写入一个快照平面,且每个快照比前一个早一个token结束,覆盖delta net的QKV卷积和PLE卷积。实测在Qwen3.8-Flash-Next UD-Q4_K_XL模型、单时隙、n-max=3 的条件下,代码解码速度从 123 tok/s提升到 183 tok/s,散文从 83 tok/s提升到 144 tok/s;无草稿基线为 108 tok/s。

信息来源

llama.cpp Releases原始来源