小米发布表格数据基础模型Xiaomi-TabLDM:仅用合成数据预训练,回归基准排名前列

该模型在OpenML-CTR23回归任务上排名第一,在TALENT、TabArena和BCCO上排名第二,且预训练仅使用结构因果模型生成的合成数据,无需任务特定微调。

AI解读:表格数据(如数据库表、Excel表)在金融、医疗等场景中广泛存在,但传统机器学习模型往往需要针对每个任务单独训练。小米团队提出的Xiaomi-TabLDM是一个通过上下文学习(in-context learning)完成分类和回归任务的基础模型,用户只需在输入中提供示例表格和相关特征,模型就能直接预测,无需针对新任务微调。这降低了领域用户使用AI的门槛,也让模型能快速适应新场景。Xiaomi-TabLDM只用合成数据预训练,这避免了获取真实表格数据的困难,同时通过更大的数据规模和多样性让模型学到更通用的表格结构知识。该模型在多个基准上表现优异:在OpenML-CTR23回归任务排名第一,在TALENT、TabArena和BCCO基准上排名第二。更值得注意的是效率:在TabArena回归任务中,它达到第二高的Elo评分,但训练时间比排名第一的TabFM少 82%,预测时间少 68%。此外,模型支持测试时扩展(test-time scaling),即推理时增加计算量可进一步提升准确率。对于表格数据分析的用户,这意味着未来可能用更低成本获得顶尖性能的预测模型,但在部署前仍需在自有任务上验证效果,因为不同数据集可能有差异。

小米研究团队在arXiv发布技术报告,介绍其表格数据基础模型Xiaomi-TabLDM。该模型面向分类和回归任务,通过上下文学习(in-context learning)直接进行预测,官方称无需针对特定任务微调即可获得较高预测精度。模型预训练仅使用由结构因果模型(SCMs)生成的合成数据,团队称这有助于更灵活地利用上下文并实现更高效的容量扩展。

基准表现与效率

据论文摘要,Xiaomi-TabLDM在多个基准测试中表现出色:在OpenML-CTR23回归任务上排名第一,在TALENT、TabArena和BCCO的回归任务上均排名第二。团队认为这证明了其在四个互补基准套件上稳定的强回归性能。此外,在TabArena回归任务中,该模型取得第二高的Elo评分,但据称训练时间比排名第一的TabFM减少 82%,预测时间减少 68%。

大规模合成预训练与测试时扩展

预训练方面,论文称Xiaomi-TabLDM扩大了合成表格数据的覆盖范围和多样性。模型采用三阶段训练策略,并结合双流特征分组(dual-stream feature grouping)、轻量级Attention Residual和稀疏混合专家(sparse Mixture-of-Experts)架构,旨在让模型学习更丰富的特征交互和专家分工。论文还提到,Xiaomi-TabLDM支持测试时扩展(test-time scaling),即在推理阶段分配更多计算资源可持续提升预测性能。该论文以arXiv:2609.03880 发布,DOI注册尚待完成。以上信息均来自论文摘要,具体方法细节和实验设置尚需查阅全文。

信息来源