新框架CHARM用轻量微调模型检测道德基础,域外AUC最高提升15.3%
arXiv论文提出将MAC交叉注意力、原理对齐与仇恨言论信号结合的道德基础检测框架,用30%训练数据在多个域外数据集上超越监督基线,并应用于Twitter疫情话语分析。
AI解读:道德基础检测长期依赖词典、微调或提示式大模型,存在跨领域泛化差、缺乏原理支撑和成本高的问题。CHARM的独特之处在于把每个组件对应到具体心理学构念:MAC交叉注意力负责道德基础与补充信息对齐,原理对齐增强输出可解释性,仇恨言论信号则依据极性调整预测。研究者仅用MFTC、MFRC和News训练池的30%子样本,加上MFTCXplain的额外监督,就在域内AUC最高提升15.3%,并且在所有域外数据集上AUC和F1都超过监督基线。这意味着实际用户——比如研究虚假信息传播或网络舆论的团队——可以用更少的标注数据和更低成本,获得比提示式大模型更稳健且可解释的检测结果。作者还将CHARM应用到Twitter上大规模COVID-19话语,发现道德价值对齐与在线点赞行为强相关。不过目前证据主要来自论文摘要,模型权重是否开放、具体推理开销都未公开;如果你想用它分析具体社交媒体数据,最好先核对官方代码库是否可用,并评估输出是否符合你的标签体系。
悉尼科技大学研究者Huixiang Fu与Marian-Andrei Rizoiu在arXiv发表论文,提出道德基础检测框架CHARM(MAC-与仇恨言论感知的、原理对齐的道德基础检测框架)。CHARM基于轻量级微调大语言模型,结合MAC交叉注意力、原理对齐和极性感知的仇恨言论信号,目的是支撑更稳健和可信的道德预测。
在MFTC、MFRC和News训练池的30%子样本配合MFTCXplain的额外监督下,CHARM在域内AUC最高提升15.3%,并在所有域外数据集上以AUC和F1两项指标超过监督基线。作者将其定位为提示式大模型检测器的可扩展、低成本替代方案。
方法与组件
论文称,与将计算与心理学理论分离的词典法、微调法和提示法检测器不同,CHARM的每个组件都对应一个明确的心理学构念:MAC交叉注意力、原理对齐和仇恨言论调节分别操作化不同的心理结构。
CHARM整合了互补的道德基础补充、原理对齐和极性感知的仇恨言论信号,以支持更稳健和更忠实的道德预测。
实验与应用
根据论文摘要,CHARM使用MFTC、MFRC和News训练池的30%子样本,以及MFTCXplain提供的更丰富监督进行训练。域内实验中AUC最高提升15.3%;在每一个域外数据集上,CHARM的AUC和F1均超过监督基线。
作者还将CHARM应用于Twitter上的大规模COVID-19话语分析,结果显示道德价值对齐与在线点赞行为有强关联。论文认为,让道德框架可大规模测量,为研究带有道德色彩的虚假信息传播提供了实用工具。