开源llama.cpp Releases·原文 2026年9月5日

llama.cpp 0.4.0发布:新增Qwen3.8-Flash-Next与Nemotron-3-Puzzle支持,ggml升级至 0.23.0

llama.cpp 0.4.0带来多项新模型架构支持、按需张量读取、服务器每槽位上下文限制、视频输入选项,以及ggml 0.23.0中引入的稀疏闪存注意力与Apple RDMA传输支持。

AI解读:这次llama.cpp 0.4.0的核心价值在于把更新的模型架构和底层性能优化同步推进。对开发者和自托管用户来说,最直接的变化是可以尝试跑Qwen3.8-Flash-Next这类新模型(尽管作者注明优化尚未完成、性能提升待后续),以及首次支持NVIDIA的Nemotron-3-Puzzle-75B-A9B——这是参数 75B而激活仅 9B的混合专家模型,本地推理内存门槛大幅降低。同时,ggml 0.23.0加入了稀疏flash attention和Apple RDMA作为RPC传输层,多GPU集群通信延迟有望更低;稀疏注意力只计算必要位置的注意力,能在长上下文下减少计算量。新引入的按需张量读取(--lazy-mode)让加载模型时不再一次性把所有权重读入内存,而是用到哪个层再读哪个层,配合量化器RAM上限设置,可缓解加载阶段的内存峰值。对普通用户,这些改进大多数自动生效,无需立即行动;但如果你运行的是多用户服务器,新的按槽位上下文限制(ctx-per-slot)能避免单个任务占满全部KV缓存,值得了解一下配置方法。

llama.cpp项目于 10 月 8 日发布v0.4.0版本。该版本主要新增了Qwen3.8-Flash-Next(qwen4exp)与NVIDIA Nemotron-3-Puzzle-75B-A9B的初始支持,并引入按需张量读取(lazy tensor reading)、服务器每槽位上下文限制、视频输入选项,同时将底层ggml升级到 0.23.0。

ggml 0.23.0的重点工作是稀疏flash attention、RPC事件/异步API,以及Apple RDMA传输支持。

新模型支持

新增对Qwen3.8-Flash-Next(架构代号qwen4exp)的初步支持,但作者注明优化改进仍在进行中。

新增对NVIDIA Nemotron-3-Puzzle-75B-A9B(架构名NemotronHPuzzle)的支持,并新增Nemotron 3.5的DSpark支持,以及nanbeige4.2-3B模型支持。

  • llama.cpp 0.4.0增加qwen4exp架构支持,但优化尚待完成(PR #27742)。
  • 新增Nemotron-3-Puzzle-75B-A9B(PR #25444)、Nemotron 3.5 DSpark(PR #27804)和nanbeige4.2-3B(PR #27730)的模型支持。

核心与API变更

新增API:llama_lazy_mode和lazy_mode,对应命令行选项 --lazy-mode(简写 -lzm)。量化参数字段增加max_buf_size,作为量化器的内存上限。

核心功能:加载模型时防止RAM峰值(按需读取张量);量化器改用row-slab流式处理以避免线程饥饿;KV缓存恢复得到优化,并新增n-gram历史查找来减少KV缓存扫描量。

新增 --n-cpu-ffn选项和逐层专家路由器/FFN支持;KV-cell跟踪每个token对应的键,并提升了会话/状态版本兼容性。

在推理图构建上,精简了MiniMax-01图结构,并禁用了非融合的GDN/LID运算以提升效率。

  • llama_lazy_mode与lazy_mode API(PR #27794);量化参数字段max_buf_size(PR #27795),避免量化时内存溢出。
  • 加载阶段峰值内存保护(PR #27483)和量化器RAM上限(PR #27795)用于降低内存压力。
  • KV缓存恢复优化(PR #27991)、n-gram历史查找(PR #28040)与停止早期序列扫描(PR #28011)用于减少推理延迟。
  • 新增per-layer expert routing/FFN(PR #28323)和 --n-cpu-ffn(PR #26622),提高混合专家模型的CPU调度能力。

服务器与多模态

服务器端新增per-slot上下文限制选项 --kv-unified-per-slot(PR #24124),允许按槽位管理KV缓存,防止单个任务耗尽全部缓存。

服务器现可接受data: URL作为视频或音频输入,便于直接传递内嵌媒体数据。

多模态方面新增DeepSeek-V4-Flash-Vision-Exp支持,修复了DeepSeek-V4图像输入处理、Gemma-4视觉处理、Gemma-4 assistant逻辑、Idefics3预处理和Qwen3-TTS的问题。

新增 --video-* 参数,用于指定视频输入文件。

  • 服务器支持 --kv-unified-per-slot / ctx-per-slot(PR #24124),按槽位限制上下文长度。
  • 支持data: URL作为input_video / input_audio(PR #27735)。
  • 新增视频参数(--video-*)与mtmd帮助函数(PR #24318)。

ggml 0.23.0与底层支持

ggml从v0.22.0升级到v0.23.0,新增了算子与后端调度API,用于支持稀疏注意力、异步执行和分配依赖跟踪。

值得注意的是新增了稀疏flash attention(ggml_flash_attn_ext_set_n_kv_max)、RPC事件/异步API和Apple RDMA传输支持;CPU、GPU与加速器后端也有多项正确性和性能修复。

在图形处理方面,为DeepSeek-V4/GLM和Qwen4exp增加稀疏flash attention实现;新增Apple RDMA作为RPC传输方案;新增RPC事件/异步后端API。

  • ggml 0.23.0版本说明:新增稀疏flash attention API操作(PR #28098)、Apple RDMA传输(PR #26421)和RPC异步事件API(PR #18626)。
  • llama.cpp为DeepSeek-V4/GLM和Qwen4exp添加稀疏flash attention(PR #27970)。

信息来源

llama.cpp Releases原始来源