新方法SISER用对抗训练抑制说话人特征,IEMOCAP情感识别UA达60.63%
韩国研究团队提出SISER,将wav2vec 2.0与ECAPA-TDNN结合,在IEMOCAP上比基线提升9.48个百分点,论文被INTERSPEECH 2026接收。
AI解读:语音情感识别最大的痛点在于:标注数据少,且不同人的说话风格差异会干扰模型判断。过去用对抗训练去掉说话人特征的做法,常用简单的分类器,效果有限。SISER的突破口是换了更强的说话人判别器——用ECAPA-TDNN(本身就是优秀的说话人识别模型)来和特征提取器对抗,逼着模型把情感信息和说话人身份剥离开。同时用wav2vec 2.0做特征提取,减少了对大规模标注数据的依赖。在IEMOCAP数据集上,SISER的未加权准确率(UA)达到60.63%,比不用说话人抑制的wav2vec 2.0(56.46%)高出约4个百分点,远超基线51.15%。对做情感计算或人机交互的开发者来说,这意味着不用再花大力气为每个说话人收集数据,模型更容易在不同人之间泛化。不过目前只在IEMOCAP一个数据集上验证,且该数据集由演员表演录制,真实场景效果还需更多测试。
韩国研究团队在arXiv提交论文(编号2609.02941),提出SISER(Speaker-Invariant Speech Emotion Recognition)方法,将wav2vec 2.0作为特征编码器、ECAPA-TDNN作为说话人判别器,融入基于熵的对抗训练框架,用于抑制说话人身份对语音情感识别的影响。论文已被INTERSPEECH 2026接收。
在IEMOCAP数据集上,SISER的未加权平均召回率(UA)达到60.63%,高于基线51.15%,也高于无说话人抑制的wav2vec 2.0(56.46%)。消融实验显示,说话人分类器的架构选择是影响性能的关键因素。