仅用一页纸的篇幅,就攻克了曾需44页顶级期刊论文才能解决的难题。这一成果,在数学界引起了广泛热议。
1991年,《数学年刊》(Annals of Mathematics)刊载了一篇44页的论文,作者是组合数学领域久负盛名的学者József Beck。他是Beck-Fiala定理的提出者,曾荣获1985年Fulkerson奖,并在1986年国际数学家大会上受邀作报告,是差异理论的重要奠基人之一。
该论文标题为《单位圆上零点多项式的模:埃尔德什的一个问题》,旨在攻克埃尔德什问题库(Erdős Problems)中编号119的难题。该问题探讨:在单位圆上选取任意复数作为零点,构成多项式,该多项式在单位圆上的最大模M_n,能否在无穷多个n处超过n的c次方。Beck证明了该结论成立,这道题在当年被誉为最难攻克的问题之一。

AI成功领取了埃尔德什设立的赏金。119号问题当年一口气提出了三个子问题,其中第三问悬赏100美元,如今其状态已更新为“已解决”。
35年后,这篇扛鼎之作被一页纸的证明所超越。
发表这一评论的是Thomas Bloom,一位数学家、曼彻斯特大学研究员,同时也是erdosproblems.com网站的创建者和维护者。埃尔德什遗留的1000多道开放问题均收录于该网站,它已成为全球数学家追踪这些问题的首要平台。正因如此,每当AI公司宣称“解决了埃尔德什问题”,都必须先通过他这一关的验证。
他在X上发文表示:
至今为止,GPT-5.6 Sol是我在数学领域所见最有趣的新模型。那些提交到erdosproblems.com的新证明,凡是我仔细审阅过的,均正确无误,且都蕴含着有趣的想法。

Bloom还特别强调,这并非因为AI使用了更复杂的数学工具,而是我们原本高估了这道题的难度,它实际上比我们想象的要简单得多。
OpenAI总裁Greg Brockman转发了这条推文,并评论道:
感觉这是数学发展进程中的一个分水岭时刻。那些能够真正改善人类生活的科学与医学突破,如今感觉近在咫尺。

埃尔德什的100美元悬赏,被AI领走
首先,我们来梳理这道题的来龙去脉。
1957年,埃尔德什在一篇论文中提出了这个关于单位圆上零点多项式模的问题,一口气问了三个子问题。在随后的四十年里,他于1961、1964、1982、1990、1997年多次重提此问题。
第一问,由Wagner在1980年成功解决。
第二问,由Beck在1991年攻克,他证明了存在某个c>0,使得max_{n≤N} M_n > N^c。这便是那篇著名的44页《数学年刊》论文。

Beck这篇论文发表于《数学年刊》1991年第134卷第3期
第三问,埃尔德什自掏腰包悬赏100美元,其出处是他1997年的一篇文章。如今,领走这笔赏金的是GPT-5.6和一位名叫Korsky的数学家。他们仅用一页纸,就解决了Beck未能触及的最后一问。

埃尔德什一生提出了上千道数学问题,并自掏腰包为它们设立悬赏,金额从25美元到1万美元不等。
Bloom评价道,GPT在Korsky的提示下,仅用1页简单的调和分析技巧,就证明了比Beck那篇44页《数学年刊》论文更强的结果。
关键的一步,Bloom后来在讨论区中点破:将一个非负函数做卷积,再在时间上做单位平移,表达式瞬间变得光滑,原本棘手的问题就迎刃而解了。他说,这种将算子范数放到对偶范数和内积中估算的方法,本就是分析学中最常用的技巧之一。并非新工具,而是旧工具被用在了无人想到的地方。

Bloom说明,Beck那篇《数学年刊》论文中包含了许多重要且有趣的思想,只是对于这道题而言并不适用。他补充了一句:至少对他而言,这相当令人意外。他还提到一个细节:没人计算过那个常数,估计非常小。Beck自己当年也没有计算,而依他的判断,如果那个常数值得一提,Beck不会不算。
所以,这并非AI推翻了顶级期刊的结论,而是发现了一条人类本可以避免的弯路。对数学家来说,这比“AI又解出一道题”更具震撼力。解出一道题,只是多了一个工具。而这一次,是工具反过来纠正了使用工具的人。
人会耸耸肩放弃,AI会继续尝试下一个方案
如果只有这一件事,它顶多算个漂亮的孤例。
GPT-5.6 Sol Ultra于7月9日全面开放,7月10日,OpenAI宣布GPT-5.6 Sol Ultra产出了Cycle Double Cover猜想的完整证明。这道题由Szekeres在1973年、Seymour在1979年各自独立提出,悬而未决约五十年。模型被分配了8小时,实际用时不到1小时,采用了64个子智能体并行工作的策略。提示词和证明PDF均已公开。
Bloom是第一个给出实质性评价的人。他说这是一个非常漂亮的证明,并用了三个形容词来描述:
简短。初等。理应在1980年代就被发现。
他也点明了背后的原因:他推测,关键在于其中有一个很小的、反直觉的转折。一个人类数学家会如何处理这道题?他会先尝试最自然的方法,检查一遍线性代数,发现行不通,然后耸耸肩,心想“本来也没指望这么容易”,便起身离开。但AI不会气馁。它会继续尝试各种微小变体,直到其中一个成立为止。AI的强大之处在于不会进行情绪化的止损。
回顾今年4月,GPT-5.4 Pro在80分钟内解决了Erdős 1196号问题,运用了von Mangoldt函数。牛津大学的Jared Lichtman在这个问题上耗费了七年时间,他后来表示,自1935年以来,所有研究原始集问题的人都习惯了同一个开局动作,而这个动作,恰恰遮蔽了一个在明处摆放了整整90年的技术可能性。陶哲轩看完后的评价更为犀利:过去几十年,人类在第一步就集体走偏了。
人类的直觉当然不是缺陷。恰恰相反,它是一种高效的筛选工具:它帮助我们省去了大量注定失败的尝试,若没有它,没人能在有限的生命里抵达学科前沿。但代价是,偶尔它也会省去本不该省去的那一次尝试。
说GPT-5.6有趣的人,去年说过另一句话
去年10月,Bloom曾公开表达过对OpenAI的不满。当时,OpenAI副总裁Kevin Weil转发了Mark Sellke的帖子并写道:GPT-5刚刚找到了10道此前未解的埃尔德什问题的解,另有11道取得了进展,这些题都已开放了数十年。

Bloom一句话便为此定性:这是戏剧性的误导。他说这些题在网站上标注为“open”,仅意味着他本人不知道有哪篇论文解决过它。GPT-5所做的事情,是把他不知道的那些文献挖掘了出来。而找到文献,不等于创造出了证明。

接下来的情形,许多人还记忆犹新。LeCun在一旁补刀,暗讽这是自己埋的雷炸了自己。Hassabis则更为直接:这太尴尬了。

Weil随后删帖。OpenAI研究员Sébastien Bubeck最终承认,只是找到了文献中已有的解答。
今年5月,OpenAI再次宣布推翻一个1946年的埃尔德什几何猜想时,在公告中同步附上了Noga Alon、Melanie Wood和Thomas Bloom的评价。
AI数学发展遭遇瓶颈了吗?
Bloom那条帖子下的论战,同样精彩纷呈。
唱衰派以用户qrdl为代表,他指出“5.6的思维链输出极为有限,677号问题毫无进展,物理侧的CritPT评测相比5.4几乎停滞”。他的结论是,AI在数学领域已遭遇瓶颈。

用户qrdl在论坛发帖,称CritPT自5.4以来几乎没有变化,除非他们找到了给基准刷分的方法,否则结果也就这样了。qrdl的论证倒不情绪化。他认为大模型本质上是静态权重的token生成器,在数学推理时,不会像人一样实时长出新的神经连接。而真正的创造性跳跃,需要一个有弹性的大脑。qrdl的体感是:每次开启新会话去攻克677,模型就会把那些早已失败过的老招式再重复一遍。
反驳的声音也来得很快。Nat Sothanaphan指出,CritPT是物理测试,并非数学基准,用它一家的曲线来证明AI在数学上撞墙,是挑选了对自己有利的数据。他给出的反证是:5.6在包括FrontierMath在内的一大批评测中都比5.5有所提升。
另一派是实战派,代表是名为old-bielefelder的用户。

old-bielefelder报告,GPT-5.6 Sol思考了14分钟、复核了9分多钟,将Pintz 2018年那个0.72的指数改进到了0.7195。这不算惊天动地,但确实取得了进展,用old-bielefelder自己的说法是“第一口奶”。作为对照,前一天晚上GPT-5.5在同一个问题上磨了一个多小时,0.72纹丝不动。他随后把结果直接通知了Pintz本人。
第三种声音同样来自Nat Sothanaphan,他借用了Bloom的一个说法:现代数学是一座巨大的教堂。走到这座教堂的最前沿本身就极为费力,而大模型已经能以超人的效率做到这一点,近期的突破基本都源于此。再往前推,需要的是流动智力。有人说大模型没有流动智力,他认为这是错误的。ARC系列评测这几年的持续上涨就是证据,GPT-5.6 Sol在最高推理档位下拿到了7.8%。这个基准今年3月上线时,最好成绩是0.37%,而人类稳定在90%以上。

ARC Prize官方验证成绩。GPT-5.6 Sol在ARC-AGI-3上的表现随推理档位陡升,Low档只有0.3%,Max档拿到7.8%。
他的解释是:教堂的地基太过庞大,庞大到将那些正在快速增长的流动智力完全掩盖住了。所以,你只看产出的分量,会觉得什么都没发生。但等到某一天,流动智力开始压过地基,它会突然变得肉眼可见。
经过两周的争论,这场论战真正吵出来的,不是“AI能不能做数学”,而是“难”这个字应该如何定义。数学史上那些标注着“悬而未决”的条目,一部分记录的是问题本身的难度,另一部分记录的是人类耐心的边界。过去这两者混在一起,无人能分得清。现在,我们开始能够区分它们了。
一道题挂了几十年无人领走,可能并非因为它有多难,而是因为没有人愿意在那条路上再尝试第三十次。
还有多少题目,卡住它们的,其实只是人类耐心的极限?
