清华团队开源单张RTX 5090训练2B模型方案,算力成本压至6.9千美元
研究人员发布Puro-2B预训练配方,用消费级GPU和FP8精度从头训练,最佳模型逼近Qwen2.5-1.5B,成本不到6900美元。
AI解读:大模型预训练通常需要巨额资金(论文举例,训练Llama-3.2-3B成本超150万美元),而清华团队公布的开源配方证明,使用单张消费级RTX 5090显卡和FP8低精度训练,能以不到6900美元的成本从头训练一个20亿参数的模型,性能接近Qwen2.5-1.5B。这项突破的核心在于硬件选型、低精度训练以及他们提出的超球优化和课程模型平均等技术组合,直接受益者是资金受限的高校和开源开发者——他们可以复制配方、在有限预算内训练自己的模型,而不只是微调现有权重。不过,成本数据基于研究者的自设评估流程,并非标准基准,且他们声称4.4千美元即可达到Qwen2-1.5B性能属于拟合估算,尚无第三方验证,实际效果仍需同行检验。
清华大学等机构的研究者发布了一项开放预训练配方,用于在消费级RTX 5090 GPU上训练Puro-2B系列模型。论文显示,该系列从零训练、最多使用1.4万亿token,最佳模型的算力成本低于6900美元,在研究者自己的评估协议下性能接近Qwen2.5-1.5B。相关论文已提交至arXiv(编号2608.27370v2),完整配方(含数据、代码和模型权重)以Apache 2.0许可开源。
成本对比与方法
研究者在论文中指出,现有开源努力包括开放权重模型和开源训练方案,但缺乏成本高效、硬件可及且完全开源从头预训练的配方。他们列举了基准成本:训练Llama-3.2-3B需超过150万美元,复现SmolLM3-3B需超过70万美元。Puro-2B系列在FP8精度下于消费级RTX 5090 GPU上训练,成本节约来自硬件选择、低精度训练、超球优化(hyperball optimization)、课程模型平均与数据配方的组合。
论文还推导出Puro成本扩展定律(Puro Cost Scaling Law),将训练成本与平均模型性能关联,拟合结果表明约4400美元(低于5090美元)即可达到Qwen2-1.5B的性能水平。
附加研究与发布形式
除配方本身,研究者还提供了两项额外成果:基于Puro-2B系列推导出训练成本与平均性能关系的扩展定律;以及一项端到端案例研究,考察预训练数据课程如何影响后训练后的下游性能。研究者强调,这些受控研究之所以可行,是因为他们掌握完整预训练流水线,而非仅有模型权重。
- 论文共63页、20张图、24张表,提交至计算语言学(cs.CL)与机器学习(cs.LG)分类。