OpenAI发布GPT-6 Astra后多次修改基准测试数据,幻觉率一度从 4.2% 改至 2% 又改回
据Fortune报道,OpenAI在 9 月 3 日发布GPT-6 Astra公告后,多次调整评测数据,部分成绩提升,对手模型成绩下调。OpenAI称修正系因测试条件差异,专家质疑存在“刷分”行为。
AI解读:AI基准测试成绩是各家公司对外比拼的“记分牌”,直接影响客户选择和投资者信心。OpenAI这次在发布GPT-6 Astra当天反复修改幻觉率、数学、编码等多项数据,一度让自己的成绩更好看、对手的更差,然后又部分改回——这暴露了一个问题:同一个模型在不同测试设置下能得出多个“合理”成绩,公司完全有条件挑最好看的那组对外宣传。斯坦福研究人员和同行工程师都指出,调整检查点、工具框架、推理等级后重跑测试很容易,且对营销更有利。对普通用户来说,最实际的影响是别把任何一家公司公布的基准分数当绝对事实,特别是看到某个模型“突然碾压对手”时,应先弄清测试条件是否公平、数据是否被反复修改过。OpenAI声称修正只是为了提供“最佳估计”,但多次来回调整至少说明其内部流程不够严谨。目前没有证据表明这些改动影响了实际模型性能,用户无需因此改变使用习惯。
据Fortune报道并获IT之家转载,OpenAI自美东时间 9 月 3 日下午发布GPT-6 Astra公告以来,已多次修改其中的评测基准数据:部分Astra成绩提升,而竞争对手Anthropic旗下模型的部分成绩被下调。网页快照显示,Astra的幻觉率一度从 4.2% 降至 2%,随后又改回 4.2%;GPT-5.6 Sol的幻觉率也从 12.2% 降至 9.4%,后又恢复至 12.2%。OpenAI发言人回应称,评测结果存在百分之几的波动,修改是为“确保数字代表对模型可用性能的最佳估计”。
公告发布过程异常,撤稿后数据已变
OpenAI原计划于美东时间 9 月 3 日下午 2 点发布博客文章,但实际晚了近两小时才恢复访问。下午 3 点 32 分,OpenAI官方X账号发出链接,页面无法打开;3 点 50 分CEO萨姆·奥尔特曼发链接并写道:“我们在部署博客文章时遇到了一点小问题,但它真的非常棒。”约一小时后页面才恢复正常。
OpenAI实际在下午 2 点过后不久就发布了博客,随后撤下。OpenAI称无法披露撤稿具体原因,但强调与基准测试成绩无关;最初解释是内容管理系统故障,后又称是互联网中断。博客重新上线后,多项评测数据已发生变化。
多项成绩被修改:幻觉率、数学测评与编码分数
互联网档案快照显示,Astra幻觉率在 9 月 3 日下午 5 点 20 分的第六份快照中从 4.2% 降至 2%,GPT-5.6 Sol的幻觉率从 12.2% 降至 9.4%;但截至报道撰写时,两项数据又回到最初的 4.2% 和 12.2%。
GPT-5.6 Sol在OpenAI内部ExploitBench网络安全评测中的成绩从 5.5% 提高至 11.5%,OpenAI表示正研究是否恢复至 5.5%,因为 11.5% 对应的是未向商业用户提供的推理等级。
Astra在FrontierMath Tier 4 (v2) 的成绩保持在 97.6% 未曾变化。但Anthropic Fable 5.1在同一测试中的成绩最初为 87.8%,后降至 78%,当前回升至 83%;GPT-5.6 Sol从 83% 降至 80.5%,又恢复至 83%。
OpenAI向媒体提供的预发布草稿显示Astra在ARC-AGI-3评测中成绩为 98.6%,公开博客中变为 99.99%。OpenAI称发布前验证导致调整属正常,并指出Arc Prize Foundation独立评估中使用特别工具框架可达 99.9%,标准框架为 63%。
Astra的编码能力评分从 57.7% 微调至 57.9%。并非所有调整都利好Astra:Anthropic两款模型在HealthBench Professional中的成绩被上调,Fable 5.1从 56.6% 升至 58.1%,Opus 5从 54.5% 升至 56.4%。
行业审视:是修正还是“刷分”?
OpenAI在博客中承认评测分数“是在任何计算资源投入下能够达到的最高成绩”,并称因测试工具框架、推理等级等因素,结果可能与用户实际使用存在差异。其系统卡对内部幻觉率评测“几乎没有提供评测方法细节”,斯坦福研究人员Anka Reuel和Mike Hardy指出,反复重跑测试可能使编码成绩小幅提升。
Snorkel AI工程师Vincent Sunn Chen认为,发布前几小时调整基准数据“并不罕见”,通常源于模型检查点、配置参数等设置的调整,但他希望行业能明确说明修改时评测条件的变化。
类似争议早有先例:2025 年Meta曾否认人为提高Llama 4成绩,但其前首席AI科学家Yann LeCun后来承认对结果进行了“修饰”。此外,新基准ExploitGym于 2026 年才推出,此前OpenAI模型在测试中曾出现失控行为。
OpenAI可能计划在 2027 年进行IPO,数据频繁变动及外界质疑可能影响其传递“最强大模型”的叙事,并让客户与投资者更难判断模型适用性。