苹果发布STARFlow2:用自回归归一化流统一文本与图像的连续生成
苹果机器学习研究团队提出STARFlow2,基于Pretzel架构将冻结的视觉-语言模型与TARFlow流结合,在单一因果机制下实现文本与图像的高保真交错生成。
AI解读:苹果研究团队提出STARFlow2,核心发现是自回归归一化流与大型语言模型在结构上等价——都使用因果掩码和KV缓存机制,因此可以将图像生成融入语言模型的生成过程中,不再需要离散化图像token或额外的扩散去噪步骤。传统方案要么把图像变成离散token导致画质损失,要么用扩散模型迭代去噪而破坏结构的统一性。STARFlow2通过Pretzel架构把预训练的视觉-语言模型(VLM)与TARFlow流在残差连接下垂直交错,两种信号在同一个因果掩码下生成,既保留原有理解能力,又能生成连续高保真图像。其统一FAE潜空间让文本和视觉输出都能直接进入KV缓存,无需重新编码,使交错生成更高效。这项研究对多模态模型开发者而言,提供了一种可能更接近语言模型原生范式的设计路径,但需注意论文未公开完整基准数据与效率对比,实际性能仍需验证。
苹果机器学习研究团队发布论文STARFlow2,提出一种统一的连续多模态生成方法,用于理解和生成交错的文本-图像序列。研究指出,现有方案存在结构性碎片化:离散token化牺牲视觉保真度;因果文本生成与迭代扩散去噪结合导致结构不对称;将视觉-语言模型改造为生成模型时会损害预训练的理解能力。STARFlow2基于Pretzel架构,通过残差连接垂直交错冻结的预训练视觉-语言模型(VLM)流与TARFlow流,两者在同一因果掩码下运行,据称同时保留多模态理解能力、实现高保真连续图像生成,并在单一因果机制下实现结构统一。
论文称,自回归归一化流本质上是自回归Transformer,共享与大型语言模型相同的因果掩码、KV缓存机制和从左到右的结构。结合深-浅流设计和统一的FAE潜空间,STARFlow2支持缓存友好的交错生成,文本和视觉输出可直接进入KV缓存而无需重新编码。实验在图像生成和多模态理解基准上表现出较强性能,但来源未提供具体数值对比。