新智元报道
10项数学难题,24小时局势反转。
这个周末,OpenAI与Anthropic这两大AI巨头,在数学研究的最前沿狭路相逢。
8月1日,OpenAI研究员Sébastien Bubeck公开宣布:他们尚未公开的下一代主力模型Astra,一口气证明了10项前沿数学成果,并同步给出了10份Lean证书及10份逐题思路复盘。
别小看这10个问题。
它们的核心结论至少十年无人推动,有的甚至搁置数十年,是实打实的开放难题。
虽算不上数学界最深奥的未解之谜,但每一道都是难啃的硬骨头。
Epoch AI旗下FrontierMath负责人Elliot Glazer直言:单论「非索菲克群」这一篇,绝对有资格登载于数学界公认的顶级期刊Annals of Mathematics。
这10道题一出,AI圈瞬间炸锅,有人当场高呼「数学奇点已至」。
Anthropic迅速接招。
不到24小时,研究员Levent Alpöge便在Bubeck的帖子下留言:「我用Fable完成了一半。」
紧接着他补充说明,自己跑出来的是OpenAI榜单上的第4、5、6、7、8项,共计5项。
Levent强调实验环境纯净:完全自主运行、使用通用提示词、全程断网。为防止OpenAI解法泄漏进上下文,他还特意增加了防护层。
当然,Levent目前尚未放出Fable完整的证明细节,但他表示后续会上传。
若此事坐实,性质便变了:
OpenAI凭借未发布的Astra抢得的首发先机,保鲜期仅余24小时。而追上来的Fable,是Anthropic早已公开、人人可调用的模型。
一项「数学首发」
保质期只剩24小时
网友Chubby转帖称:「公开可用的Fable,复现了Astra一半成果。」
评论区有人调侃:这么看,OpenAI是不是只抢了个首发?
以往,一项数学成果的优先权之争,通常以年为单位。
谁先想到、谁先证出、谁先发表,中间隔着漫长的投稿、审稿、修改周期。
如今,Astra尚未正式发布,其公布的成果在短短24小时内,已被一个公开模型追平了一半。
首发的含金量仍在,但保质期大幅缩短。
不少网友已在喊「数学奇点」,两家巨头也紧紧咬合。
2000美元背后
还有更贵的账
OpenAI还抛出一个数字:找到这10项解法,成本不足2000美元。
按研究员Noam Brown的说法,这对应的是寻找解法所需的token费用,再依Sol API价格折算得出。
换言之,这仅是成功跑出10个解法那一刻的边际推理成本。
此外,还有Astra本身的训练研发、那些尝试未果的问题、人类将论证整理成249页论文的工时、把每个证明形式化成Lean的成本,以及最终外部数学家审查的费用。
Noam自己也承认,他们还尝试过其他重大问题但未成功,千禧年大奖难题无一拿下。
即便如此,2000美元仍将AI解开前沿难题的边际成本压至地板价。
有人甚至调侃,OpenAI明天是否会再公布10项突破,或等到下周一次发布100项。
从「互相刷榜」到「互相验货」
Fable去重做Astra同一批题,这件事比普通刷榜有趣得多。
刷榜测的是已知答案:题目和标准答案摆在那儿,比谁分高。
而两个模型在无网络、防泄漏条件下,各自独立抵达同一前沿结论,测的是完全不同的东西:结果是否可靠,能否被独立复现。
这更像同行评审。
Levent目前仅在X上「作出了声明」,并未放出那5项证明的PDF、提示词、完整运行日志、token成本或Lean证书。
网友Haider质疑:即便属实,为何要用Fable复现Astra,而非直接拿它去解新的开放问题?
事实上,Fable并非只会蹭Astra热度,它也会解新题。
7月,Levent就用Fable给出过Jacobian猜想的三维反例,事后还有人专门撰写了一份7页的代数验证材料,确认该显式映射确实推翻了三维及更高维的猜想。
绝大多数人看不懂的成果
谁来验收
这10项成果究竟有多重要,绝大多数人难以判断。
Ethan Mollick一语道破:对地球上几乎每个人而言,这不仅是超出能力,更是超出理解范围。我们只能信赖专业数学家告知其分量。
代码、图片、聊天,普通人尚能亲手体验AI强在哪。
可非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,这些只有极少数专家能读懂。
AI能力越向科学前沿延伸,公众能依靠的就越非亲身体验,而是一条长长的信任链。这种「连惊叹都无从惊叹」的状态,正越来越多领域同时发生。
数学家Thomas Bloom提醒,这些成果依托的是上百年积累的数学理论、数学家亲手搭建的形式化系统,将其简单描述为「AI取代了数学家」并不诚实。
他给出的标准是:这份证明,有没有教给我们关于这个问题的新东西?
所以真正的问题来了:当AI能低成本、批量生产前沿数学证明,我们到底该拿什么衡量其成果?
答案或许不在产出端,而在验收端:一份证明能否被读懂、被核对、被判断出分量,才最终决定其真实价值。
最稀缺的能力,正从「做出证明」转向「看懂并验收证明」。
当AI一夜之间便能证出十道难题,真正的考验才刚开始:证明越造越快,我们的验证,还追得上吗?
参考资料:
编辑:元宇
秒追ASI











