新型扩散增强模型Uno实现LLM无损加速,8B版本多项评测优于26B DiffusionGemma
研究团队提出扩散增强LLM,用轻量扩散权重并行生成多个token,无需草稿模型即可实现最高3倍加速,8B Uno模型在智能体工具使用、编程和长上下文推理上超越现有开源与商业扩散LLM。
AI解读:这篇论文的核心是解决大模型生成速度慢的问题。传统自回归模型只能一个词一个词地顺序输出,速度受限;现有加速方法如投机解码需要额外的小模型配合,而纯扩散模型又可能牺牲输出质量。研究团队提出的方案叫扩散增强LLM:把模型参数分为两部分,一部分保留标准自回归能力保证质量,另一部分是轻量的扩散权重,用来同时生成多个token。他们训练出的Uno模型无需草稿模型,在多种批量大小下吞吐量都超过投机解码方法,最高比基础自回归模型快3倍。尤其值得注意的是,8B参数的Uno在智能体工具调用、编程和长上下文推理测试中超过了目前领先的开源26B DiffusionGemma和商业模型Mercury 2。这意味着:如果该结果可复现,中小规模模型无需借助外部草稿模型就能大幅提速,相关应用(如实时对话、长文档处理)的推理成本和延迟都可能降低。不过,目前论文还未提交最终版本,实际效果需代码和checkpoint释出后验证。
研究人员在arXiv发表论文,提出一种名为Uno的扩散增强大语言模型(diffusion-augmented LLM),在不牺牲底层自回归模型质量的前提下实现最多3倍加速。该论文于2026年9月3日提交,作者来自多个机构,包括Subham Sekhar Sahoo、Lingjie Chen、Khiem Pham等。
Uno模型将参数分为两部分:使用标准自回归训练的自回归权重,以及通过称为Diffusion Distillation的阶段学习的轻量扩散权重。该阶段据称对现有LLM训练流程增加可忽略的额外开销。新的采样器家族Ψ-Spec支持在固定上下文长度下的无损加速和推理时扩展。
根据论文摘要,Uno不需要投机解码所需的独立草稿模型,也不同时拖累底层自回归模型的质量。8B Uno模型在智能体工具使用、编程和长上下文推理的全部评测基准上,优于领先的开源26B DiffusionGemma以及商业模型Mercury 2。