刚刚,最后一道FrontierMath Tier 4的难题被GPT-6 Astra攻克了。
至此,这套曾被视为大模型数学难关的研究级测试,所有题目都已至少被AI成功解答过一次。
Epoch AI也正式宣布,FrontierMath Tier 4已经饱和。
从图表来看,Astra并未直接达到100%的准确率,OpenAI公布的成绩是97.6%。
但根据Epoch的统计方式,“全部解出”指的是综合不同模型和不同时间的尝试后,Tier 4中的每道题都已有成功解答的记录。
而Astra解决的,正是此前唯一未被AI攻破的那道题。
(简单来说,Astra可能在某次测试中出错,但它正确解答的题目是之前无人能解的)
坦白说,这个发展速度相当惊人。
如果你关注模型评测,就会知道2025年7月11日Tier 4刚推出时,最高成绩只有大约5%。
如今仅过了一年零两个月,这道曾经的“高墙”已变成“台阶”,最后一道难以通过捷径绕道解决的问题也被跨越。
出题人、马凯特大学数学副教授Jay Pantone表示,以往AI都会寻找数值捷径,而这次AI的解法与自己相当接近。
不过,在最近GPT-6 Astra集中向数学界发起猛攻、三天两头解决千禧年难题之际,Pantone表示自己已经很难感到惊讶了。
可以说,数学俨然成为Astra近期刷存在感最强烈的领域之一。
从不足2%到专门增设一道“研究级防线”
FrontierMath最初于2024年11月7日发布,其诞生的目的就是为了避免数学Benchmark过快被AI攻破。
当时,像GSM8K、MATH这样的传统数学Benchmark已越来越难拉开头部模型之间的差距,于是Epoch AI联合60多位数学家,重新设计了一批此前从未公开过的原创题目。
其中,包括陶哲轩、Timothy Gowers、Richard Borcherds等菲尔兹奖得主。
陶哲轩当时看完一些研究级题目后直言,这些题“极其困难”,甚至判断最难的Tier 3可能还需要几年时间才能被AI攻克。
结果第一轮测试下来,果然不出所料,领先模型的正确率还不到2%。
具体来说,在最开始,FrontierMath的核心题库共有300道题,按难度分为Tier 1、Tier 2和Tier 3三个层级。
Tier 1大致接近高难度本科题和数学奥赛,但允许使用更高级的工具;Tier 2已到高年级研究生难度;Tier 3则更接近博士生早期遇到的探索性研究问题。
但随着推理模型的出现,前三层逐渐不够用了,于是2025年Epoch又增加了一层,Tier 4。
Tier 4大多由数学教授和博士后设计,每人围绕自己的研究方向进行数周短期研究,最后将成果压缩成一道可自动验证的问题。
最初,Tier 4共收录了50道题,涵盖分析、数论、组合数学、拓扑、代数几何等领域。
发布之初,所有模型历次测试加起来只有3道题曾被解出,且这些解答还依赖了一些正确但未充分论证的假设。
鉴于此,在官网的公开样题页面上,Epoch一度写道:其中一些题,可能几十年都不会被AI解决。
(这句话现在开始被反复提及)
不过,随着模型越来越强,另一个问题也暴露出来:题库本身也开始经不起AI的“拷打”。
OpenAI在测试过程中发现,FrontierMath中的错误比预期更多。
随后Epoch启动独立审计,先用GPT-5.5和Claude Opus 4.7筛查疑点,再交给数学家逐题复核。最终在2026年6月推出v2版本,其中Tier 4修正了12道题、移除了7道题,留下43题。
修订之后,模型的成绩依然一路攀升。
GPT-5.6 Sol达到83.0%,Claude Fable 5达到90.2%,到了GPT-6 Astra,成绩已升至97.6%。
更关键的是,Astra还补上了此前唯一一道从未被AI解出的题。
至此,Tier 4中的每道题都至少被AI成功攻破过一次。这套专门为最强模型增设的研究级防线,最终也被突破了。
不过,这并不意味着“数学已被AI解决”。恰恰相反,FrontierMath已开始向下一阶段发展。
现在整个项目除了Tiers 1-4,还增加了真正的Open Problems,以及将Erdős开放问题形式化进Lean的FrontierMath Erdős。
前者直接拿尚未被数学界解决的研究问题考模型;后者则要求AI写出能通过形式化验证的完整证明。
这一次,Astra在FrontierMath Erdős的68道问题中,只解决了2道。
故事仍在继续~华体会体育网站
本文来自微信公众号“量子位”,作者:henry,36氪经授权发布。













想了解更多将复杂的游戏世界观设定与体验顺序同步解读,降低理解门槛。相关内容,尽在华体会娱乐。
华体会娱乐围绕平台内容围绕游戏话题持续更新,保持与玩家社区的同步。不断创新,回应用户的真实需求。
回复 20分钟前