开源llama.cpp Releases·2026年9月3日

llama.cpp两日更新覆盖多模态、推理与硬件后端

9 月 2 日至 3 日的连续构建加入Nemotron-3-Puzzle支持,并修正DeepSeek-V4视觉、Qwen3 TTS、Vulkan、CUDA与Metal路径。

AI解读:如果你在自己的电脑或服务器上跑模型,这批更新最实际的用处是补上模型和硬件之间的兼容缺口:新加入的模型能否加载、图片或音频能否正常输入、某种显卡后端是否出错,都比构建版本的数量更重要。用到Nemotron或报道所列视觉、语音模型的开发者有直接核对更新的理由;没有碰到这些问题的用户,不需要跟着31次构建逐个升级。CUDA和Metal的改动也不等于所有电脑都会更快,更新时应保留当前可用版本,用自己的模型和任务确认收益。

llama.cpp在两天内发布了 31 个自动构建版本。与其逐条展示构建号,本稿按功能归并主要变化:模型侧加入NVIDIA Nemotron-3-Puzzle-75B-A9B支持,并修正DeepSeek-V4-Flash-Vision与Qwen3 TTS 0.6B的多模态加载路径。

服务端新增视频和音频data URL输入;推理后端则覆盖Vulkan Flash Attention解量化路径、CUDA MoE加权归约融合、Metal调优、OpenCL越界读取修复以及多种Hexagon算子。

这些版本属于高频项目快照,包含大量平台二进制和小修复。生产环境升级时应锁定具体构建号,并针对所用模型与硬件后端单独回归。

信息来源

llama.cpp Releases官方发布记录