新推测解码框架SFAD:提升大模型上下文忠实度并实现2.48倍加速

arXiv论文提出SFAD,结合ConFide偏好数据集、Epistemic Friction检测与Asymmetric Logit Steering,在减少幻觉的同时不牺牲推理效率。

AI解读:大模型在知识密集型任务中常产生与上下文不符的幻觉,现有缓解手段要么需要双次前向传播对比、推理开销翻倍,要么依赖大量强化学习对齐、训练成本高昂。SFAD走的是“推测解码”路线:先用带细粒度扰动的偏好数据集ConFide训练一个上下文忠实的草稿模型,推理时通过Epistemic Friction实时度量分布张力来预判幻觉;一旦超过阈值,就用Asymmetric Logit Steering修正目标分布,否则走标准推测流程。根据论文摘要中的实验数据,该方法在明显提升忠实度的同时取得2.48倍加速,对部署方意味着可以用接近现有的推理成本获得更可靠的生成结果。需要注意的是,目前结论基于arXiv摘要与论文自述,尚未有第三方复现或公开基准对比,实际收益需在具体任务上验证。

一篇发表在arXiv上的论文(编号2609.00796)提出了SFAD(Speculative Factuality-Aware Decoding),一个旨在提升大语言模型上下文忠实度(contextual faithfulness)的推测解码框架。论文称,该方法在增强事实一致性的同时实现了2.48倍加速。

方法与组件

SFAD由三个主要组件构成:ConFide、Epistemic Friction和Asymmetric Logit Steering。作者首先构建了ConFide,一个带有细粒度原子扰动的偏好数据集,用于通过直接偏好优化(DPO)训练一个上下文忠实的草稿模型。

推理机制

在推理阶段,Epistemic Friction通过量化以专家确定性加权的分布张力,检测潜在的幻觉。当摩擦力超过阈值时,Asymmetric Logit Steering通过基于残差的logit注入来优化目标分布;否则执行标准推测。

实验结果与背景

论文报告称,大量实验表明SFAD在显著提高忠实度的同时实现了2.48倍加速,为高效LLM提供了实用解决方案。作者指出,对比解码方法需要双前向传播(有上下文和无上下文)来比较模型输出,使推理计算开销加倍,而训练后对齐则需要大量强化学习,计算开销巨大。

信息来源