Epoch AI发布FrontierMath Erdős基准:68道公开数学难题,GPT-6 Astra在预算内解决3%
新基准由数学家Thomas Bloom挑选68道重要且未解决的Erdős问题,要求AI在300美元推理预算和72小时内以Lean形式化证明或证伪。首轮测试中,仅预发布版GPT-6 Astra解决了2题(3%),其余四款模型得分为0。
AI解读:Epoch AI推出FrontierMath Erdős基准,目的不是再添一个AI数学榜单,而是把此前公司内部、方法不透明的AI解数学题过程,变成可重复、可验证的公开测试。基准选了68道由数学家Thomas Bloom主观挑选的、他认为重要且困难的未解决Erdős问题(约占2026年8月时未解决问题总数的10%),要求AI在每道题300美元推理预算、72小时时限内,用Lean证明或证伪。首轮结果:预发布版GPT-6 Astra解决了2道(3%),GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1和Claude Fable 5均未解决任何一道。对AI能力圈而言,这说明能解决个别重大难题的模型,面对任意一道同类问题成功率仍很低,且形式化要求(如把18页的证明改写为120万行Lean代码)本身就是额外负担。对关注AI科研能力的机构来说,这个基准提供了更可靠、可复现的衡量尺度,但若想评估自家模型,需注意基准目前按固定预算运行,且未来存在数据污染风险(现已开放代码和问题列表,可自行复现)。个位数解题率和高昂计算成本(5个解累计花费超22万美元)提醒,当前AI在数学研究上仍是偶发突破,而非稳定能力。
Epoch AI发布新数学基准FrontierMath Erdős,包含68道由数学家Thomas Bloom挑选的未解决Erdős问题。这些题目截至2026年8月全部未解,约占当时Bloom网站上652道未解决问题(总数1217道)的10%。AI系统须在每道题300美元推理预算和72小时时限内,用Lean写出通过验证的证明或反例。首轮测试中,预发布版GPT-6 Astra解决了2道(得分3%),GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1和Claude Fable 5均得0分。
Bloom在帮助Epoch AI策划另一个未解数学问题基准时曾表示,任何数学家看到列表都会质疑部分选择,但只要同时认可另一些题目的深度和价值,说明选得不错。Epoch AI称,Bloom粗略估计到2026年8月AI已解决约3到5道该级别的Erdős问题,因此这68道题对AI提出了较高门槛。
基准解决三大问题:筛选、验证、重现性
Epoch AI指出,Erdős问题此前已成为非正式追踪AI数学能力的核心基准,但缺乏统一标准。该基准针对三个问题作出调整。
筛选方面,Erdős问题难度和重要性参差不齐,许多从未吸引数学家关注,后来被证明用适度努力即可解决(无论人类还是AI)。Epoch AI请Bloom挑选他个人认为数学上重要且困难的未解决问题,共得68道。Epoch AI承认这种选择高度主观,但表示即便粗略分类也比过去的状态有显著改进。
验证方面,研究数学中人类用自然语言证明,人工核对极其耗时,不适合规模化评估AI。基准采用Lean(一种专门表达数学证明的编程语言)实现程序化验证。Epoch AI主要依托两个现有项目:谷歌的Formal Conjectures项目(68题中50道已在该项目中形式化),以及Lean FRO(开发Lean的组织)构建的证明检查器Comparator,后者设计为对抗试图作弊的提交。Epoch AI让AI形式化了剩余18道,这些陈述较简单,已通过初步审查,但Epoch AI自认不是Lean专家,错误可能存在,正在寻求额外专家评审。
重现性方面,迄今最引人注目的AI解数学题成果多来自AI公司内部,这些公司很少披露实验细节。Epoch AI称其贡献在于透明度:整个基准代码库已开源,主框架和68道题列表均公开。默认每道题给AI系统300美元推理预算。
基准存在三项局限。其一,形式化给AI系统增加额外负担:例如OpenAI模型曾生成Erdős单位距离猜想(Bloom网站问题90)的解决思路,自然语言证明18页,但随后用Lean形式化该结果需120万行代码,因为需从基本原理推导一个尚未在Lean标准库中形式化的“深层”结果。Epoch AI表示,任何基于Lean的开放问题基准都有此限制。其二,数据污染会随时间成为问题:基准最初按“经典”公开基准运行,模型无互联网访问,仅获得离线数学论文集和计算机代数系统等工具,但解决方案最终会进入训练数据。Epoch AI计划监控污染程度,并可在训练截止后通过过滤已解决问题来校正;负结果仍具信息量——若后模型未能解决前模型已解决的问题,可能表明其后数学能力较弱。其三,Erdős问题不能代表全部数学:Epoch AI预计该基准上的进展与总体数学能力进展至少部分相关,但这种推断并非严密。
首轮结果与额外尝试
Epoch AI已运行五款模型:预发布版GPT-6 Astra、GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1和Claude Fable 5。每个模型对每道题尝试一次,预算300美元、工作时间72小时。题目在模型生成通过验证的Lean证明或反例时算作解决。
首轮基准分数:GPT-6 Astra得分3%(解决68道中的2道),其余四款模型均为0%。GPT-6 Astra以218美元成本和15小时工作推翻了问题74(找到反例),以247美元和16小时证明了问题126。所有其他尝试,包括其他四款模型的每次尝试,均因预算耗尽而无验证证明。
Epoch AI还进行了基准之外的额外尝试,使用同一预发布版GPT-6 Astra,但预算更大、代理设置不同、每道题尝试次数不同。Epoch AI强调这不属于基准分数——GPT-6 Astra的基准得分仍为首轮表的3%——但仍予以报告,因为解决这些问题的任何结果都有数学价值,且重复尝试能提示结果差异。
跨所有额外尝试,GPT-6 Astra至少一次解决了68道中的5道:除上述两道外,还推翻了问题1,证明了问题548和问题571。多数剩余问题总共尝试2至5次(共172次尝试),均未解决。达到这5个解累计花费超过22万美元计算成本,基准运行本身约2万美元。
额外尝试结果:问题1被推翻,2次尝试中成功,每次成本405美元和1,384美元;问题74被推翻,6次尝试全部成功,成本47至271美元;问题126被证明,4次尝试全部成功,成本154至249美元;问题548被证明,3次尝试中1次成功,成本363美元;问题571被证明,3次尝试中1次成功,成本617美元。Epoch AI称:“表格并非基准结果”,完整细节及五个解的简要总结见论文,新模型发布后会持续评估,最新结果发布在基准页面上。
结论
Epoch AI总结称,最令人印象深刻的AI数学成果来自公司内部,但方法透明度较低。该基准旨在澄清状况:在此框架和预算下,Astra解决了约3%的重要开放数学问题,这为AI驱动数学突破的普及率提供了有用数据点——真实存在但仍较罕见。Epoch AI表示,虽然AI能解决任何此级别的问题都值得注意,但AI对任意此类问题的成功率并不高——至少在需要每道题300美元预算内形式化结果的情况下如此。
Epoch AI指出,五个AI解的性质有待数学家消化和评论。Lean本身必然有bug,但Epoch AI预计误报极其罕见,且出现时不难识别。