Ollama发布v0.33.1:新增Qwen3.8 Flash Next MLX支持与结构化输出
修复Metal GPU在从慢速存储加载模型时的超时问题,并更新MLX与llama.cpp后端。
AI解读:这次v0.33.1更新主要面向在苹果芯片Mac上跑本地模型的用户。Ollama的MLX后端(专门优化苹果GPU的推理引擎)这次加入了对Qwen3.8 Flash Next模型的支持,说明这类新模型可以直接用MLX加速了;同时mlxrunner增加了结构化输出能力,意味着可以强制模型按JSON等格式输出,这对做本地自动化任务的开发者更友好。另一个实际修复是避免从慢速存储(比如外接硬盘或网络盘)加载模型时触发Metal GPU超时,以前可能因此中途失败。需要留意的是,这个版本没有改动模型库本身,也未公布性能数据,实际提速效果需要自己上手验证。
Ollama于 2025 年发布v0.33.1版本,主要新增对Qwen3.8 Flash Next的MLX支持,并为mlxrunner加入结构化输出能力,同时修复了Metal GPU在从慢速存储加载模型时的超时问题。