Diffusers 0.40.0发布:新增LTX-2.5、MiniMax-H3等管线,Modular Diffusers转正,初步支持张量并行
Hugging Face发布Diffusers 0.40.0,新增多条视频、音频管线,将Modular Diffusers从实验性转为稳定支持,并加入张量并行推理支持;同时移除JAX/Flax支持并弃用torch_dtype。
AI解读:这次Diffusers 0.40.0的核心变化是把模块化架构(Modular Diffusers)转正,并以此为基础快速接入多家新模型。对开发者来说,最直接的信号是:以后接入新模型不必再等官方单独写一套完整Pipeline,直接复用模块化积木的组合方式,因此新模型往往与新版发布同步可用。此次新增的MiniMax-H3(视频和音轨联合生成)、MiniMax Music 3(最长5分钟整曲)、Wan-Animate-2(角色动画化)、Stable Audio 3(44.1kHz立体声音频)等,都是官方与模型方或社区合作打包的结果。硬件层面,新增的张量并行推理支持(CUDA和AWS Neuron)能让超大规模DiT模型(如FLUX.1、FLUX.2、Qwen-Image)在多卡上拆分运行,但这需要用户自行配置tp_mesh,属于面向高级用户的功能,并非开箱即用。需要警惕的是两处破坏性变更:JAX/Flax支持被完全移除,torch_dtype参数弃用并将在 1.0.0 中删除,老代码需迁移到dtype。此外,修复了一个可通过分片检查点索引文件实现的路径遍历漏洞,建议及时升级。
Hugging Face于 2025 年发布Diffusers 0.40.0。该版本引入多条新管线,包括LTX-2.5、MiniMax-H3、MiniMax Music 3、Wan-Animate-2、Stable Audio 3和JoyAI-Image-Edit-Plus,同时将Modular Diffusers从实验性转为稳定支持,并加入初步的张量并行推理支持。
新管线覆盖视频、音频与图像编辑
MiniMax-H3由MiniMax提出,可同时生成视频及其音轨。该模型使用单一transformer对一个包含文本条件、条件媒体、目标视频与音频潜变量的打包序列进行去噪,无需独立声码器或后期音频处理。其文本条件编码器为Qwen3VLForConditionalGeneration,读取第 50 层解码器层的非归一化隐藏状态而非最后一层。MiniMax-H3仅以Modular Diffusers块形式集成,提供t2va、fl2va、ref2va三种工作流,可在from_pretrained时裁剪。
MiniMax Music 3根据歌词和音乐描述生成最长五分钟的完整歌曲,支持表现力人声和长程结构。该模型结合自回归与扩散阶段:一个基于Qwen3的 80 亿参数全局语言模型逐帧预测语义音频token,一个小型深度解码器填充 7 个残差RVQ码本,二者融合的隐藏状态用于条件化一个 24 亿参数的流匹配transformer,生成Flow-VAE潜变量并以重叠块处理,最终由DAC风格解码器输出 44.1kHz立体声音频。
Stable Audio 3是Stability AI的文本生成音频模型,输出 44.1kHz高质量立体声音频。它采用rectified-flow DiT,基于冻结的T5Gemma文本编码器(通过交叉注意力)和时长(浮点嵌入并用于自适应层归一化),并使用SAME自编码器解码。提供StableAudio3Pipeline、StableAudio3AudioToAudioPipeline和StableAudio3InpaintPipeline三个管线。该集成由 @buffett0323贡献。
Wan-Animate-2由阿里巴巴Wan团队开发,可使用驱动视频的动作来动画化参考角色图像。驱动视频按固定长度分段处理:每个片段先提取参考并缓存K/V,然后基于缓存去噪并在循环内解码。提供基础检查点(带无分类器引导)和蒸馏检查点(少步采样、无引导)两种预设。集成由 @kelseyee贡献。
LTX-2.5复用现有LTX2Pipeline类,但改用Gemma 4 (gemma4_unified) 作为文本编码器。Lightricks/LTX-2.5-Diffusers仓库同时提供蒸馏DiT (transformer/) 和完整/SFT DiT (transformer_full/)。此外新增LTX2VideoDiffusionDecoderModel和LTX2VideoDiffusionDecodePipeline(第二视频解码器,潜变量与主解码器可互换)、duration_head(自动预测帧数)、提示增强功能(通过google/gemma-4-E2B-it)以及用于Modular Diffusers的LTX25AutoBlocks。
Modular Diffusers转正与核心库更新
Modular Diffusers不再标记为实验性,API警告已移除。新集成中MiniMax-H3、MiniMax Music 3和Wan-Animate-2仅以Modular块形式提供。Cosmos 3和Krea 2获得模块化管线,Anima增加img2img块。此外,为条件管线分支添加了默认输入处理,组卸载现在可在自动卸载下工作。
张量并行推理现已在CUDA和AWS Neuron(Trainium/Inferentia)上受支持,通过TensorParallelConfig启用;分片由 _tp_plan驱动,已应用于FLUX.1、FLUX.2和Qwen-Image DiT。
新增量化后端:SDNQ支持int8至 2-bit低位量化,可在CUDA、ROCm、XPU、MPS和CPU上运行;Nunchaku Lite用于加载预量化检查点。
diffusers-cli为智能体使用重新设计,支持保存和加载自定义块,并新增diffusers-cli skills命令。JAX/Flax支持被移除,约 12000 行代码被删除。torch_dtype弃用,改用dtype,将在 1.0.0 中移除。DDUF弃用,警告将在 0.41.0 中移除。修复了一个通过分片检查点索引文件实现的路径遍历漏洞,并添加了SECURITY.md。