GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑
靳紫馨(Vivian Jin)
靳紫馨(Vivian Jin)

2026-09-07

GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑

一份最初因“技术故障”被撤下的公告,随着重新上线后数据的反复波动,演变成了一场关于AI基准测试公信力的风暴。

9月3日,OpenAI正式发布新一代旗舰模型GPT-6 Astra,宣称这是“目前全球最智能、且对齐程度最高的模型”。然而,这场备受瞩目的发布从一开始就充满了反常。

据《财富》杂志报道,OpenAI原计划于美东时间9月3日下午2点发布博客,但页面长时间无法访问。CEO奥特曼发文称遇到“小问题”,OpenAI解释为“内容管理系统故障”和“互联网中断”。但事实是,博客在下午2点后不久曾短暂上线,随即被撤下。

真正的争议在博客重新上线后才开始。外界发现,Astra的多项评测数据经历了反复修改。

幻觉率是此次争议的焦点。互联网档案记录显示,最初版本中Astra的幻觉率为4.2%。但在页面可正常访问后,该数据一度被降至2%,几乎减半;最终又被调回4.2%。GPT-5.6 Sol的幻觉率也从12.2%降至9.4%后又恢复。

竞争对手的成绩也出现了异常波动。 部分更新使Astra表现更优,而Anthropic旗下模型的成绩则出现下滑。Anthropic的Fable 5.1在FrontierMath Tier 4中的成绩曾从87.8%降至78%,随后又回升至83%。部分调整甚至发生在首次发布博客之前。

ARC-AGI-3成绩的变化同样引人注目。 Astra在该测试中最高取得99.9%的成绩,但该分数从发布前的98.6%被提升至99.99%。而独立测试显示,在另一套评测框架下Astra仅得62.7%。OpenAI声称99.9%的成绩标志着AGI时代的来临,但ARC Prize官方表示,他们并未宣称AGI已实现。

面对质疑,OpenAI发言人回应称:“我们非常重视评测结果的准确性。由于具体使用的模型检查点、测试框架和评测运行方式不同,大多数评测结果本身都会存在几个百分点范围内的波动。对于发布公告中的数据,我们进行了修正,以确保这些数字能够代表我们对模型可用性能的最佳估计,让用户能够进行有意义的比较。”

然而,这一解释并未平息争议。外界认为此次风波是AI行业长期存在的“Benchmaxxing”(刷榜)现象的缩影——即通过反复调整测试条件、运行方式来最大化基准测试成绩。此前,Meta等公司也曾因测试数据问题面临类似质疑。

基准测试成绩对于AI公司的市场定位与商业拓展至关重要,但数据频繁变动与由此引发的信任危机,不仅让企业客户和投资者难以准确评估模型的实际适配性,也对OpenAI长期的市场叙事和品牌公信力构成了严峻挑战。当“最强模型”的证明本身开始动摇,行业对“刷榜”的信任危机被彻底引爆。