mistral-inference v1.1.0发布,支持加载LoRA权重进行推理
新版mistral-inference可加载由mistral-finetune训练的 7B LoRA权重,并提供了代码示例。
Mistral AI于 2024 年发布了mistral-inference v1.1.0(版本号 1.1.0),新版本允许加载通过mistral-finetune训练生成的LoRA模型权重,并在基础模型推理时直接应用这些权重。
示例代码说明
发布说明提供了Python示例,运行时用户需指定基础模型路径、tokenizer文件、LoRA检查点文件(如checkpoint_000300下的lora.safetensors),模型加载后即可通过generate函数进行对话式生成。
示例使用 7B基础模型作为LoRA的训练基底,并设置max_tokens=64 和temperature=0.0 来生成回答。
- 模型加载使用Transformer.from_folder(MODEL_PATH) 读取基础模型目录。
- LoRA权重通过model.load_lora() 方法加载,路径指向 .safetensors文件。
- tokenizer文件名为tokenizer.model.v3,需从模型目录中指定。
- 生成过程引入mistral_common库构建ChatCompletionRequest。