新研究提出ROMS-IMLE:单步生成模型在ImageNet 256上实现FID 2.56

arXiv论文摒弃迭代去噪与Transformer,仅用隐式最大似然估计和中等规模卷积网络,在ImageNet 256上达到FID 2.56。

AI解读:这篇论文挑战了扩散模型和流匹配的核心理念——必须通过多个小步骤将噪声逐步转换为数据。作者认为这个过程并非必需,而是用最简单的训练目标(IMLE)和中等规模的卷积网络,设计出单步生成的模型ROMS-IMLE,在ImageNet 256上FID达到2.56,同时保持了良好的精确度和召回率。对研究者而言,这意味着生成模型可能不需要复杂的迭代架构和Transformer,就能达到接近主流方法的性能,从而降低计算成本、提升生成速度。不过,论文目前只是arXiv预印本,尚未经过同行评审,且FID等指标是在特定数据集上测得的,实际部署到其他任务或数据集前仍需验证。

7月21日提交、9月3日更新的arXiv论文(编号2607.19332)提出ROMS-IMLE,一种放弃迭代去噪与Transformer架构的单步生成模型,在ImageNet 256上达到FID 2.56。

作者Chirag Vashist和Ke Li以极简思路出发:只保留训练目标和模型两个核心要素,训练目标选用隐式最大似然估计(IMLE),模型则采用中等规模的卷积网络,有意避开变分推断、对抗训练和数值积分等复杂模块。

论文摘要指出,他们“审慎地添加了真正必要的元素”,而这些元素并不包括迭代去噪。该模型最终实现单步、参数高效的生成,同时获得良好的精确度与召回率。

信息来源