开源Ollama Releases·2026年9月5日

Ollama v0.32.15发布:缓存模型元数据使首字延迟减半,优化桌面首次启动流程

新版本通过缓存已解析的模型元数据,将时间到首字(TTFT)从约 995 ms降至约 524 ms;同时修复流式解析错误导致会话卡死的问题。

AI解读:Ollama在v0.32.15中解决了两个直接影响用户体验的问题。一是通过缓存模型元数据,避免每次请求都重复解析,从而将首字延迟几乎减半,这对频繁调用API或使用交互式聊天的开发者来说,意味着更快的响应和更流畅的本地推理体验。二是修复了此前在流式输出中如果发生解析错误,可能导致聊天或生成请求永久卡住(wedge)的缺陷,这保障了长时间运行或复杂输出场景下的稳定性。该版本还针对Qwen 3.8模型统一了系统消息的处理逻辑,并更新了MLX和llama.cpp依赖。对于普通用户,只需升级到最新版本即可自动获得这些改进,无需额外配置。

Ollama于 2025 年 4 月 10 日发布v0.32.15,该版本主要改进了桌面端首次启动的引导流程,并通过缓存模型元数据将平均时间到首字(TTFT)从约 995 毫秒降至约 524 毫秒。

信息来源

Ollama Releases原始来源