热点资讯

  • Home
  • GPT-6首次挑战成功,破解5道Erdős数学难题

GPT-6首次挑战成功,破解5道Erdős数学难题

近期,GPT-6 Astra这个刚刚问世的AI模型展现了其卓越的数学能力,成功破解了5道Erdős难题。这一壮举源于Epoch AI与曼彻斯特大学共同发布的FrontierMath Erdős(FME)基准测试论文。此次测试包含68道人类尚未解决的数学难题,而5个顶尖AI模型在此次测试中同场竞技。值得一提的是,GPT-6 Astra在这场竞争中成为“唯一一个得分非零的模型”,其得分率高达3%。而其他四个模型,包括GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1和Claude Fable 5,则均未能答出任何题目,成绩皆为0分。

在进一步的测试中,放宽了计算预算后,GPT-6 Astra成功解答了5道难题。其中一道难题是Erdős本人在1931年提出的“也许是我第一个认真的问题”,而另一道则是被称为“极值图论中最诱人的问题之一”的Erdős-Sós猜想。值得注意的是,陶哲轩对此次测试给予了批评,促成了这一考试的评估。

about image

近来有关AI攻克数学问题的消息频频传出。例如,2026年5月,OpenAI宣布AI成功反驳了单位距离猜想,随后在7月,数学家利用Claude Fable 5发现了三维Jacobian猜想的反例,8月时OpenAI公布了AI在十个数学及理论计算机科学问题上取得的新成果,其中也包括数个Erdős难题。然而,陶哲轩在2026年国际数学家大会(ICM)报告中明确指出,许多成就并非在严谨的科学环境下获得,存在五个主要问题:只报告成功而不统计失败导致成功率难以判断,计算资源消耗未公开,人类引导程度不透明,训练数据可能包含已知解,以及不同模型未进行系统比较。FME正是对这些质疑的直接回应。

FME的设计逻辑包括三个核心原则:第一,选择未解的问题,以避免数据污染;第二,要求AI以Lean证明助手的方式提交形式化证明,通过与否可由Lean核心决定;第三,所有模型在相同条件下进行答题,每道题的预算为300美元,工作时限为72小时。之前存在的HorizonMath与FrontierMath: Open Problems(FM:OP)依赖“生成-验证”模式,仅能涵盖那些具备可计算性验证解的问题,而难以包含大多数需要证明的一般性命题。

FME的形式化证明规范扩展了覆盖范围,只要猜想的陈述能够在Lean中形式化,就可以被纳入基准。即使猜想为假,模型也可以通过证明其否命题完成任务。验证过程的安全性通过多个隔离的Docker容器进行,AI在一个容器中工作,而验证则在不与网络连接的另一个容器中完成。这一流程有效防范了各种作弊手段。

about image

选择68道Erdős难题的过程由第二作者Thomas F. Bloom负责,他从网站erdosproblems.com中挑选了652个开放问题,最终选出最难且具数学意义的问题。Bloom表示,任何一道被人类解决的问题都值得在顶级期刊上发表,并引起相关领域研究者的关注。大多数入选问题已经吸引了大量数学家的关注,但此前被AI解决的某些Erdős问题较为冷门。

单位距离猜想(第90号)、第146号和第183号等问题属于知名领域问题,解决这些难题标志着AI在数学研究能力上跨越了新的里程碑。FME意在确保参与的难题具有同等的挑战性,确保每道题相互独立,解开一道题不应直接导致另一道题的答案。如果发现潜在的蕴含关系,本身便是数学研究上的一项重要成果。Erdős在生前常常为自己的问题设定悬念和挑战。

about image

发表评论