Ex-Omni-2D:让多模态对话模型输出带参考形象的协调语音视频
arXiv论文提出一种框架,使全模态对话模型在回答问题时同步生成文本、个性化语音与参考条件视频,先规划视觉思想再用流式学生模型低延迟产出视频。
AI解读:现有全模态对话模型虽能听懂多模态输入并合成语音回复,但用户只看得到声音,看不到回应者的形象。Ex-Omni-2D的思路是给模型加一个"视觉形象":回答时先生成一份关于场景、情绪和动作的Visual Thought Plan,再让它驱动一个参考人物的视频,配合语音一起输出。这样应用场景就从纯语音助手扩展到了数字人客服、虚拟教师这类需要有可见形象互动的场景。技术上,训练阶段使用全序列Teacher模型保证视频质量,再蒸馏出一个四步四GPU的流式Student模型,在 400×720 或 720×400 分辨率下提供增量输出,启动延迟低于Teacher。局限在于论文尚在arXiv预印本阶段,没有公开效果对比数据,"流式前缀机制减轻后期主体漂移"的分析也仅基于作者实验,实际表现需在真实任务中进一步验证。
arXiv预印本论文(编号 2608.10720,2026 年 9 月 3 日更新v2)提出Ex-Omni-2D框架,使全模态对话模型能够以协调的文本、个性化语音和参考条件视频来回答多模态查询。
据论文摘要,模型先写出一个结构化的Visual Thought Plan(VTP),涵盖场景、情绪和动作,再生成回复文本与多码本语音单元,这些语音单元被解码为音频并与视频帧对齐,让语音模块和形象模块拥有共同的时间信号。
训练与推理设计
视频模块作为全序列Teacher进行训练,条件来自参考外观、VTP语义和帧对齐的语音单元。
作者进一步将该模型蒸馏为少步、块因果的流式Student;其Prefix Streaming机制将之前的干净隐状态传递到下一个块,被分析为对后期块主体漂移的部分缓解。
在 400×720 或 720×400 分辨率下,四步四GPU的Student模型提供增量输出,启动延迟低于全序列Teacher。