EmoDistill:用情绪技能蒸馏训练小型语言模型,提升对抗谈判中的议价效用

新框架将大语言模型间的情绪谈判技能蒸馏到7B参数小模型中,在四个谈判领域多数场景下优于基线,去除情绪通道会显著降低总体效用。

AI解读:EmoDistill的核心是解决一个具体矛盾:经过后训练的大语言模型被调教得礼貌、乐于助人,但在对抗性谈判中,这种温顺反而成了漏洞——对手一句带情绪的话可能让AI在不经意间让步,损害用户利益。研究者让大模型之间互相谈判,把其中有效的情绪表达策略提炼出来,教给更小的7B参数模型。方法分两步:先判断在什么谈判状态该表露哪种情绪(用Implicit Q-Learning),再由模型学会用恰当的话把情绪表达出来(监督微调加评判优化)。实际效果是,在四个测试领域多数情况下,完整版EmoDistill的谈判效用胜过普通策略和只用情绪选择器的版本;去掉明确情绪表达后,整体谈判收益明显下降,说明情绪手段确实有用。缺点是技能迁移有领域限制,没法保证所有谈判场景通吃。对开发者而言,这套方法的价值在于不必每次用昂贵的大模型跑完整对话,就能让落地的小模型在谈判任务中更维护用户立场。目前没有真实用户测试数据,情绪策略会不会让对手反感或陷入僵局,论文里没回答。

arXiv上发布的一篇论文提出EmoDistill框架,可将大语言模型(LLM)之间的情绪化谈判技能蒸馏到较小的语言模型代理中。论文于2026年5月26日首次提交,9月3日更新第二版,作者包括来自牛津大学等机构的Yunbo Long、Haolang Zhao、Lukas Beckenbauer、Liming Xu与Alexandra Brintrup。

研究动机是:经过后训练的LLM通常被优化得乐于助人、礼貌且顺从,但在对抗性谈判中,这种特性可能成为弱点——带有情绪框架的语言可能让代理做出与用户目标相悖的让步决策。

方法与训练

EmoDistill将情绪谈判技能定义为“状态条件行为”,即决定在某个谈判状态调用哪种明确情绪,以及如何将该情绪实现为有效的谈判话语。框架分开学习两个组件:一个基于隐式Q学习(IQL)的选择器学习在每个谈判状态该表达哪种情绪;一个经LoRA适配的 7B参数策略模型通过监督微调(SFT)和评判策略优化(JPO)学习情绪条件下的表达方式。

评估结果

在四个对情绪敏感的谈判领域中,完整的EmoDistill策略取得了具有竞争力的效用,并在大多数设置下优于纯文字基线(vanilla)和仅用IQL的基线。

  • 无情绪消融实验显示,移除明确情绪通道会显著降低整体谈判效用。
  • 迁移实验显示技能存在部分、依赖领域的迁移,并且对未见过的LLM对手具有鲁棒性。

信息来源