LLaDA-Image开源:6B扩散Transformer实现文生图与精细编辑

新模型在Qwen-Image-Bench英文和中文赛道均创开源模型最佳成绩,并发布权重、训练代码和配方;另有 2-4 步推理的Turbo蒸馏版本。

AI解读:这篇论文展示了一条减少对图文配对数据依赖的扩散模型训练路径:先用 2.2 亿纯图像样本做预训练和中训练,建立视觉生成先验,再接入冻结的LLaDA2.0-Mini视觉语言模块,使 6B参数的Diffusion Transformer既能生图也能做细粒度编辑。对研究者而言,最大价值在于作者开源了模型权重、训练代码和完整配方,意味着可以复现这套做法,而不是只能调用一个黑盒API。对需要快速生成或反复迭代图像的应用方,Turbo蒸馏版把采样步数压缩到 2-4 步,直接降低推理成本。但论文的基准分数来自Qwen-Image-Bench这一平台,分数上限是 53.53 和 53.38,排在国内开源模型之首,是否真优于闭源商用模型仍需要更多对比数据。普通用户暂时不必行动,若团队正做图像生成或编辑的产品,可以下载权重实测,以确认它在你自己的任务上的实际表现与编辑指令遵循度。

arXiv预印本论文介绍了LLaDA-Image,一个将 6B参数Diffusion Transformer(DiT)与冻结的视觉语言理解模块相结合的图像生成框架,作者称其在Qwen-Image-Bench英文和中文两个赛道均创下开源模型最佳成绩,并已发布模型权重、训练代码和配方。

训练方法与数据构成

据论文摘要,LLaDA-Image没有从开始就依赖大量图文配对数据,而是先通过仅图像的预训练和中训练构建视觉生成先验。整个生成管线的数据包含 220M个样本,其中 98 个是真实图像。论文使用Muon优化器,配合在DiT中全程应用的免参数RMSNorm,以实现高效且可扩展的优化。

性能与模型变体

在Qwen-Image-Bench基准上,LLaDA-Image的整体得分英文赛道为 53.53,中文赛道为 53.38,作者称在这两个赛道上都达到了开源模型中的新最先进水平。此外,作者通过蒸馏得到LLaDA-Image-Turbo,可在 2-4 步采样内完成快速推理。

开放资源与作者信息

为支持后续研究,作者公开了模型权重、训练代码和详细配方,论文由Jun Xie等共 29 人署名,提交历史显示v1版本于 2026 年 9 月 3 日发布。论文标注arXiv:2609.03796,对应CS.CV与CS.AI分类。

信息来源