llama.cpp b10778发布:修复模型加载阶段内存峰值问题
ggml-org发布llama.cpp b10778,主要变化是阻止模型加载时的RAM峰值(PR #27483),并同步提供多平台二进制包。
AI解读:这次llama.cpp更新解决的是一个具体痛点:之前加载大模型时内存占用会突然冲到峰值,可能让显存或内存本就不宽裕的机器直接卡死或崩溃。修复来自社区的PR #27483,专门限制加载阶段的内存尖峰,让本地运行LLM的用户在启动时更不容易因资源不足而失败。真正受影响的是那些在低配电脑或共享服务器上跑大模型的人,他们的可用模型体积上限可能会因此提升。不过要注意,这次版本只动了加载路径,不改变推理速度或精度,也别指望老显卡靠它跑起之前带不动的模型。
llama.cpp项目于b10778版本修复了模型加载阶段内存尖峰(RAM peaking)问题,对应PR #27483。该版本同时提供了各平台的预编译二进制包。