新研究:可解释AI热力图不能代表rPPG模型真实读取位置,皮肤归因不保证心率估算准确
瑞典研究者量化四种解释方法在RhythmFormer远程光电容积描记模型上的表现,发现Beyond Intuition在跨数据集上表现最佳,但所有方法在单一片段层面与心率误差等指标几乎无关。
AI解读:这项研究直接挑战了远程光电容积描记(rPPG)领域的一个默认做法:用热力图来‘解释’模型从哪里读取脉搏信号。作者用皮肤覆盖率和一个叫SaCo的忠实度系数,把四种解释方法在RhythmFormer模型上做了量化对比,发现Beyond Intuition在跨数据集上表现最好,但更关键的结论是——在单个视频片段上,热力图得分和心率估算误差、波形相关性这些实际性能指标几乎不相关,186个相关系数中多数都低于0.10。对研究者来说,这意味着热力图只能告诉你模型‘看哪里’,不能告诉你它‘算得准不准’,皮肤区域的高亮并不能保证心率准确。这篇92页的论文还揭示了一个具体的失败场景:在40 lux的极暗光照下,Beyond Intuition的覆盖率中位数骤降到0.180、SaCo降至-0.178,而运动干扰导致的估算误差更大却没有这种下降,说明不同干扰对解释指标的影响并不一致。普通用户不需要立即做什么,但如果你正在用rPPG模型做研究或开发,应该把这项研究当作一个提醒:解释方法需要验证适用条件,不要想当然地拿热力图当性能的代理指标。
瑞典研究者发表的一项预印本研究对远程光电容积描记(rPPG)模型的解释方法做了系统性量化检验,结论是:热力图在单个视频片段层面与心率估算误差等性能指标几乎无关,皮肤归因不保证估算准确。论文由Louis Chen和Torbjörn E. M. Nordling撰写,发布于arXiv(编号2609.03663),共92页、38幅图,含补充材料。
方法:八种条件下训练模型,四种解释方法对比
研究团队在NCKU-rPPG数据集上训练了八个针对不同条件的RhythmFormer模型,条件包括三种光照水平、说话、旋转和骑行,每个片段时长5.12秒并估算一次心率,另在UBFC-rPPG数据集上复现了一个模型作为对照。他们用皮肤覆盖率和Salience-guided Faithfulness Coefficient(SaCo)两种指标,评估了Raw attention、rollout、attention flow和Beyond Intuition四种解释方法。
结果:跨数据集表现不一,单一片段层面解释与性能脱钩
Beyond Intuition在两个数据集上均排名最高:在Static level 3条件下,其覆盖率中位数为0.789、SaCo为0.837,而在UBFC-rPPG上分别达到0.826和0.917。较低的排名在两个数据集上存在差异。在单个参与者和单个条件内部,两种指标与片段的绝对心率误差、波形相关性或信噪比在两个数据集上均无关联——252个相关系数中有186个低于|ρ|=0.10,达到p<0.05显著水平的有28个,而随机期望值约为13个。跨八个场景比较时,只有Beyond Intuition的覆盖率跟上了三项性能指标(相关系数分别为-0.43、+0.57、+0.43);仅依赖注意力的方法的SaCo则与性能指标方向相反。
- 在40 lux的极暗光照下,Beyond Intuition的覆盖率中位数降至0.180、SaCo中位数降至-0.178。相比之下,运动干扰会使估算误差更大,但解释指标没有出现同样幅度的下降。
结论:解释指标是补充信息而非性能代理
作者总结称,皮肤覆盖率和SaCo携带的信息与性能指标互补,不能作为性能的代理;归因于皮肤并不能保证估算准确。就所揭示的条件而言,归因方法告诉人们的是模型看哪里,而不是它的映射多么有序。研究依据的是论文摘要,完整细节需查阅全文。