RCProb为树集成规则提取引入概率估计,对数损失中位降幅达71.9%

arXiv新论文提出RCProb方法,改进RuleCOSI+提取规则的概率可靠性,在RF和GBM上显著降低对数损失并减少规则数量。

AI解读:这篇论文解决的是“规则提取出的结果概率不准”的问题。用随机森林或梯度提升树做分类时,模型本身是黑箱,RuleCOSI+这类方法能抽出一小套“如果-那么”规则来解释模型,但它给每条规则配的概率是从训练数据里直接数出来的经验值,而且在规则合并简化过程中反复使用这些统计量,导致概率可能失真,影响后续的可靠性判断。RCProb的做法是为搜索阶段使用平滑的原子类别条件证据,为最终概率引入一种支持度自适应的混合估计,相当于把概率估算从“事后补救”改成“过程的一部分”。作者在18个二分类和5个多分类数据集上对比,中位配对对数损失比RuleCOSI+降低71.9%(RF)和62.5%(GBM),规则数量约减少38.7%和38.5%,分类准确率(宏F1)没有显著差别。对普通读者来说,这项研究主要影响需要用可解释规则做高stakes决策的人,比如信用评估、医疗辅助诊断中既要模型表现又要向监管或用户解释的场景。它带来的实际变化是:不用再额外做温度缩放等后处理,原生概率就够用,但论文也承认额外的后处理仍能进一步提升。目前只是预印本并投稿期刊,尚未看到大规模落地应用,因此相关从业者不必马上切换工具,可先在自己的数据上验证。

arXiv于 2026 年 9 月 3 日更新的论文(v3)提出RCProb,一种针对树集成规则提取的概率扩展方法。作者Josue Obregon称,RCProb在 18 个二分类和 5 个多分类数据集上,相对RuleCOSI+使中位配对对数损失降低 71.9%(RF)和 62.5%(GBM),经Holm校正后仍显著,同时规则数量减少约 38.7%(RF)和 38.5%(GBM)。

方法动机与RCProb做法

论文指出,树集成分类性能强但通常表现为黑箱,事后可解释技术如RuleCOSI+提取小规则集逼近集成,但这种简化可能使规则附带概率不可靠。RuleCOSI+赋予提取规则经验类概率,并在贪心合并和简化过程中反复使用这些规则统计量。

RCProb在昂贵搜索阶段使用平滑原子类条件证据,最终规则概率采用支持度自适应混合,并结合基于集成的m-估计。

实验设置与结果

方法在 18 个二分类和 5 个多分类数据集上使用随机森林(RF)和梯度提升机(GBM)集成评估。主检验未检测到宏F1差异;置信度ECE在两个集成上均下降,RF经校正后统计显著。

另设带专用校准数据的对照实验显示,RCProb原生概率与RuleCOSI+加温度缩放后的性能相当,但额外的事后校正确实仍可改善RCProb。论文由此认为概率估计是规则提取的重要组成部分,而非仅是后处理步骤。

信息来源