Mistral与NVIDIA联合模型Mistral-Nemo登陆mistral-inference v1.3.0,Apache 2.0许可开放下载
mistral-inference v1.3.0发布,新增对12B参数Mistral-Nemo-Instruct-2407的支持,支持聊天与函数调用,模型以Apache 2.0许可发布。
AI解读:Mistral与NVIDIA合作训练的Mistral-Nemo模型本周进入mistral-inference工具链,意味着开发者可以本地跑起这个12B参数的模型,而不必依赖云端API。对普通用户来说,最直接的价值是:它保留了Mistral 7B的'即插即用'便利,但上下文窗口从8k拉到了128k,能一次性处理更长的文档或代码;对多语言和代码的专门训练也让它处理非英语内容时更稳。另一个关键点是Apache 2.0许可——没有商用限制,企业可以把它集成进自己的产品甚至二次分发。不过要注意,目前发布的是指令微调版本,托管权重只有instruct版,基座模型需另从Hugging Face获取。如果你想本地体验,需要约24GB显存(以FP16估算),普通消费级显卡跑不动;函数调用功能已经能跑通示例,但实际效果取决于模型的工具遵循能力,目前没有独立评测。
mistral-inference v1.3.0于7月18日发布,正式支持Mistral-Nemo-Instruct-2407模型。该模型由Mistral AI与NVIDIA联合训练,是Mistral-Nemo-Base-2407的指令微调版本,以Apache 2.0许可发布,可作为Mistral 7B的直接替代。
新版本通过pip安装mistral-inference>=1.3.0即可使用,模型权重需从models.mistralcdn.com下载(约24GB tar包)。支持命令行聊天(mistral-chat)和Python API调用,Python示例中包含温度参数0.35、最大生成长度1024 tokens的设置。
函数调用(function calling)功能已可用,示例展示了定义天气查询工具并传入用户消息的完整流程,生成参数为max_tokens=256、temperature=0.35。
模型规格与许可
Mistral-Nemo是一个Transformer模型,架构参数:40层、维度5120、隐藏维度14436、32个注意力头(其中8个KV头,使用GQA)、词表大小约128k(2^17),使用SwiGLU激活函数和旋转位置编码(theta=1M)。
该模型预训练和指令微调版本均有提供(基座版本位于Hugging Face),训练于128k上下文窗口,并使用了大量多语言和代码数据。
基准测试得分
发布说明中列出了多项基准测试结果:HellaSwag 83.5%、Winogrande 76.8%、OpenBookQA 60.6%、CommonSenseQA 70.4%、TruthfulQA 50.3%、MMLU(5-shot)68.0%、TriviaQA 73.8%、NaturalQuestions 31.2%(均为0-shot,除非注明)。
多语言MMLU子集得分:法语62.3%、德语62.7%、西班牙语64.6%、意大利语61.3%、葡萄牙语63.3%、俄语59.2%、中文59.0%、日语59.0%。