开源llama.cpp Releases·2026年9月5日

llama.cpp b10749发布:指定YaRN缩放时自动调整训练上下文长度

该版本通过PR #28030 实现上下文的自动缩放,并同步更新了各平台的预编译二进制文件。

AI解读:这次更新解决了一个实际问题:当用户用YaRN扩展模型上下文时,旧版本要求手动同步调整n_ctx_train,否则训练阶段与推理配置不一致会导致错误或性能异常。b10749的改动(PR #28030)让n_ctx_train在指定YaRN缩放时自动缩放,减少手动配置出错的可能。对经常微调或扩展Llama类模型的开发者来说,这降低了上下文长度参数不匹配的调试成本;内层实现更稳健,但日常推理不受影响。普通用户无需立即升级,只有使用YaRN扩展或重新编译代码的人才需要关注这一修复。

llama.cpp项目发布b10749版本,核心改动是当指定YaRN(Yet another RoPE extensioN)缩放时,自动调整n_ctx_train参数,合并请求编号为 #28030。

上下文长度与发布文件

该版本修复了YaRN缩放场景下的上下文长度设置问题,旨在保证训练阶段与扩展后的上下文配置一致。

  • 仓库提供了针对macOS(Apple Silicon arm64、Intel x64)、Linux(Ubuntu x64/arm64/s390x,支持Vulkan/ROCm/OpenVINO/SYCL等)、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO等)和Android arm64的预编译二进制。
  • 部分平台构建被禁用:macOS Apple Silicon的KleidiAI变体(见PR #23780)和openEuler相关构建(见PR #23705);UI包单独提供。

信息来源

llama.cpp Releases原始来源