中国软件公司49名员工30个月面部表情数据公开,称最长自然工作场景情绪数据集

研究团队WELD数据集涵盖733,780帧七类面部表情概率向量,并发现现成面部表情识别模型对亚洲中性面孔存在系统性“愤怒”过度预测。

AI解读:情绪计算研究大多依赖实验室数据,缺少真实工作场景中长期、稳定的团队情绪记录。WELD数据集用49名中国软件公司员工、30.1个月(2021年11月至2024年5月)的面部表情被动感知数据填补了这一空白,是目前最长的自然场景情绪语料库。它让研究者首次能在同一批人身上同时进行个体纵向和团队关系分析,并提供了情绪波动方差中个体差异(19.3%)和月度季节性(29.8%)的量化上限。对企业和HR系统开发者而言,关键发现是:现成的面部表情识别(FER)模型对亚洲中性面孔存在系统性偏差——将“愤怒”概率平均预测为0.194,而西方面孔的基准约为0.05,这意味着直接部署这类模型可能造成误判。数据集采用四级访问模式,仅聚合概率可公开下载,个体数据受限,普通读者无需立即行动,但相关开发者在选择情绪识别工具时应关注此类偏差审计结果。

arXiv预印本平台发布了一个名为WELD的自然场景情绪数据集,覆盖中国一家软件公司49名员工在30.1个月(2021年11月至2024年5月)内的733,780帧七类面部表情概率向量。论文称这是目前时长最长的自然场景(in-the-wild)情绪语料库,也是唯一支持对同一批被试同时进行个体纵向和团队关系多年度分析的语料库。数据采用四级访问模式发布,仅聚合概率可公开下载。

数据来源与验证

数据集来自49名中国软件公司员工,通过全被动感知协议收集,无需被试主动操作。研究团队验证了三个已知情绪现象:周末效价提升43.1%、13:00低谷的日内周期、以及上海2022年封控效应(Cohen's d = -0.40)。

该数据集在2026年5月和9月两次修订,v3版本修正了去除泄露后的流失率指标(二元AUC=0.79,存活C-index=0.52),并新增了FER公平性审计。

四类新发现:方差分解、情绪状态与工作流失预测

论文报告了四项新发现。方差分解显示,日常效价方差中19.3%归因于个体间差异,29.8%归因于月度季节性。研究团队认为,这为未来预测模型设定了量化上限。

隐马尔可夫分解识别出六种情绪状态,负性状态的持续时间不对称(16-18天vs 3天)。流失(turnover)预测方面,留一法(leave-one-person-out)的AUC达到0.79,但Cox一致指数仅为0.52。论文指出,这一矛盾暴露了一个“度量陷阱”:仅报告AUC而不使用存活感知基线会产生误导。

此外,现成的FER模型(facial expression recognition)在亚洲中性面孔上系统性过度预测“愤怒”类别,平均预测概率为0.194,而西方脸的先验约为0.05。作者称这使得WELD可用于FER公平性审计。

信息来源