开源llama.cpp Releases·2026年9月5日

llama.cpp b10782发布:修复多GPU下CUDA图优化被跳过的问题

新版本允许每个设备分片独立启用CUDA图优化,并修复了CUDA事件绑定到错误GPU的问题;默认行为不变,仅在GGML_CUDA_GRAPH_OPT=1 时生效。

AI解读:这次更新针对使用多张NVIDIA GPU运行大模型的场景。此前,llama.cpp的CUDA图优化在多GPU配置下会被整体跳过,导致推理性能无法充分利用;而且一个与并发流相关的CUDA事件可能被错误地绑定到第一张GPU上,影响后续设备的执行。b10782修复了这两个问题:优化现在按每个设备分片独立进行,并在创建事件前显式切换到目标GPU。实际效果是,开启GGML_CUDA_GRAPH_OPT=1 的多GPU用户可以期待更稳定的并行推理,特别是在跨卡分割模型时。需要注意的是,这次改动默认不改变行为,只有主动启用该环境变量才生效;对单GPU或未开启优化的用户没有影响。如果你是llama.cpp的多卡部署者,可以拉取新版本并在测试环境验证性能提升。

llama.cpp发布b10782版本,主要修复了多GPU环境下CUDA图优化被跳过的问题。此前的保护条件导致多GPU配置无法应用图优化,而新版允许在每个设备分片上独立执行优化,因为图已经按设备分割,优化只需针对每个分片运行一次,不涉及整个模型。

修复还处理了CUDA事件绑定错误:事件ggml_cuda_concurrent_event归属于创建时“当前”的GPU,若优化在GPU 0为当前设备时运行,事件会固定到GPU 0,导致第二张GPU创建事件时也落到GPU 0。修复方法是在创建事件前显式调用ggml_cuda_set_device(cuda_ctx->device),该模式复用了ggml_backend_cuda_graph_compute中的做法。

默认行为保持不变,仅当设置GGML_CUDA_GRAPH_OPT=1 时启用。

信息来源

llama.cpp Releases原始来源