研究:TabM在车险精算定价中数据扩展效率显著优于表格Transformer与MLP
arXiv新研究用真实车险组合比较各类模型在不同数据规模下的泊松偏差表现,发现架构对数据扩展指数影响明显,单纯扩大Transformer参数规模收益有限。
AI解读:这篇研究要解决的是保险精算中一个实际选型问题:当数据量增加时,哪种模型进步更快。研究者在真实车险组合上比较了不同模型族,发现TabM的数据扩展能力明显强于监督式表格Transformer和标准MLP,而Transformer只有加入TabM式适配或自监督等归纳偏置后参数扩展才会变好。对精算师或保险科技团队来说,这意味着如果公司想靠积累更多数据提升定价模型,优先选择TabM这类在表格数据上扩展效率更高的架构,比盲目加大Transformer规模更划算。研究还指出损失函数和架构设计共同影响效果,但结论基于单一车险数据集且未提供具体扩展系数数值,实际应用时仍需结合自身数据验证。
arXiv上的新研究(编号2609.03106,提交于2026年9月2日)首次系统考察了精算定价中是否出现类似深度学习的扩展规律。作者Ronald Richman使用真实车险组合数据,训练不同模型家族在逐步增大的数据子集上评估样本外泊松偏差,结果发现TabM的数据扩展指数明显强于纯监督表格Transformer和标准MLP;Transformer除非加入TabM风格适配或自监督等归纳偏置,否则参数扩展表现弱。
模型与评估方法
研究以真实车险组合为数据基础,训练了多种模型家族,覆盖不同架构类型,并在多个随机种子下进行实验。评估指标是样本外泊松偏差,该指标基于似然的损失函数,用于泊松计数预测,数值越低表示样本外拟合越好。
- 对比模型包括TabM、监督式表格Transformer、标准MLP基线,以及加入TabM风格适配或自监督的Transformer变体。
- 通过逐步增加训练数据比例来测量各模型的数据扩展行为。
主要发现
所有模型家族都随数据增加而改善,但数据扩展指数存在显著差异。TabM表现出比纯监督表格Transformer和标准MLP更强的数据扩展能力;Transformer变体只有在加入额外归纳偏置(如TabM风格适配或自监督)后才呈现明显的参数扩展。
作者认为这些结果为不同数据规模下的模型选择提供了量化指导:在精算表格任务上,有效扩展依赖于架构和损失函数目标的设计,单纯扩大Transformer规模只能带来有限的改进。