Mistral Inference发布v1.4.0,Pixtral 12B模型新增图像输入支持
该版本允许开发者通过CLI或Python API向Mistral模型传入零个或多个图像,并结合文本prompt进行多模态对话。
AI解读:Pixtral-12B模型此次更新意味着Mistral的推理工具链正式具备了原生视觉理解能力,而不只是单独发布一个模型权重。开发者现在可以用一条pip升级命令,在本地加载模型后直接输入图像URL或本地路径,让模型执行“描述这张图”这类任务。这对需要图像理解、但又不希望把标注数据或业务图片发给云端API的团队尤其有用,例如做内部图片审核或私有数据上的视觉问答。此次更新的核心价值在于推理代码与模型同步开放,降低了在本地复用多模态能力的门槛。但要注意,安装仅支持全精度权重下载和本机推理,没有给出量化或更省显存的部署方案;小批量交互式测试可以用CLI工具完成,但要大规模并发推理还是需要用vLLM或SGLang这类专用服务框架,当前这个release本身并不提供这部分支持。
Mistral的推理代码库mistral-inference于 9 月发布v1.4.0版本,正式为Mistral模型加入图像输入能力,支持在文本提示之外传入零个或多个图像。
更新后,用户可先用pip升级mistral_inference至 1.4.0 或更高版本,然后从Hugging Face下载mistralai/Pixtral-12B-2409模型权重(包含params.json、consolidated.safetensors与tekken.json)。运行 `mistral-chat` 并指向模型目录后,即可在对话中粘贴图片URL,模型会针对图像给出文字回答。
Python开发者也可通过Transformer、generate与MistralTokenizer等组件自行编码请求,在ChatCompletionRequest中把ImageURLChunk与TextChunk一起传给UserMessage,模型将返回最多max_tokens个token的文本结果。