Ex-Omni框架:为全模态大模型加入语音伴随的3D面部动画生成

新框架通过解耦语义推理与时序生成,使全模态大模型能协同输出文本、语音和3D面部动画,并配套发布120万样本的弱监督数据集。

AI解读:这篇论文解决的是全模态大模型(OLLM)难以同时生成语音和3D面部动画的问题,核心障碍在于大模型擅长离散的语义推理,而面部动作需要密集的时序变化,两者节奏不匹配。Ex-Omni的做法是把语义推理和时序生成分开处理:先用一个带blendshape协同监督的语音单元生成器提供时间骨架,再用非自回归解码器生成面部动作,中间通过一个门控融合接口来控制语义信息的注入。这样做的直接效果是模型在不牺牲原有语音问答能力的前提下,能原生输出与语音同步的面部动画,实验显示其同步性和人工偏好已接近教师模型Audio2Face-3D级联的水平。对做数字人、虚拟助手或游戏角色动画的开发者来说,这套方案意味着可以用一个统一模型同时处理语义理解和面部表现,而不必单独跑两套系统;论文也公开了1.2M样本的InstructS2SF-1200K数据集,可用于训练和评测。不过目前结果来自论文实验,具体推理速度、资源占用和跨语言效果尚未公开,需要实际测试才能判断部署成本。

arXiv论文提出Ex-Omni(Expressive Omni)框架,为全模态大语言模型(OLLM)增加与语音伴随的3D面部动画生成能力。论文指出,此类模型此前主要统一多模态理解与生成,但联合生成语音和3D面部动画的路径尚未被充分探索,关键难点在于大模型离散的语义推理与3D面部运动所需的密集时序动态之间存在不匹配。

Ex-Omni将语义推理与时序生成解耦,采用带blendshape协同监督的语音单元生成器(speech-unit generator)和非自回归blendshape解码器(non-autoregressive blendshape decoder):语音单元提供时间骨架,隐藏语音表征携带面部相关线索。

研究还引入token-as-query门控融合(TQGF)接口,用于受控的语义注入;并发布InstructS2SF-1200K数据集,含120万条弱监督样本,供语音伴随面部动画训练使用。

性能表现与作者结论

论文实验显示,Ex-Omni在保留具有竞争力的语音问答能力的同时,能够原生生成协调的文本、语音和3D面部动画,并在同步性和人工偏好方面接近Audio2Face-3D教师级联的表现。该论文由Haoyu Zhang、Zhipeng Li、Yiwen Guo和Tianshu Yu撰写,归类于计算机视觉与模式识别(cs.CV)、人工智能(cs.AI)和计算与语言(cs.CL)。

信息来源