新智元报道

10项数学难题,24小时局势反转。

这个周末,OpenAI与Anthropic这两大AI巨头,在数学研究的最前沿狭路相逢。

8月1日,OpenAI研究员Sébastien Bubeck公开宣布:他们尚未公开的下一代主力模型Astra,一口气证明了10项前沿数学成果,并同步给出了10份Lean证书及10份逐题思路复盘。

别小看这10个问题。

它们的核心结论至少十年无人推动,有的甚至搁置数十年,是实打实的开放难题。

虽算不上数学界最深奥的未解之谜,但每一道都是难啃的硬骨头。

Epoch AI旗下FrontierMath负责人Elliot Glazer直言:单论「非索菲克群」这一篇,绝对有资格登载于数学界公认的顶级期刊Annals of Mathematics。

这10道题一出,AI圈瞬间炸锅,有人当场高呼「数学奇点已至」。

Anthropic迅速接招。

不到24小时,研究员Levent Alpöge便在Bubeck的帖子下留言:「我用Fable完成了一半。」

紧接着他补充说明,自己跑出来的是OpenAI榜单上的第4、5、6、7、8项,共计5项。

Levent强调实验环境纯净:完全自主运行、使用通用提示词、全程断网。为防止OpenAI解法泄漏进上下文,他还特意增加了防护层。

当然,Levent目前尚未放出Fable完整的证明细节,但他表示后续会上传。

若此事坐实,性质便变了:

OpenAI凭借未发布的Astra抢得的首发先机,保鲜期仅余24小时。而追上来的Fable,是Anthropic早已公开、人人可调用的模型。

一项「数学首发」

保质期只剩24小时

网友Chubby转帖称:「公开可用的Fable,复现了Astra一半成果。」

评论区有人调侃:这么看,OpenAI是不是只抢了个首发?

以往,一项数学成果的优先权之争,通常以年为单位。

谁先想到、谁先证出、谁先发表,中间隔着漫长的投稿、审稿、修改周期。

如今,Astra尚未正式发布,其公布的成果在短短24小时内,已被一个公开模型追平了一半。

首发的含金量仍在,但保质期大幅缩短。

不少网友已在喊「数学奇点」,两家巨头也紧紧咬合。

2000美元背后

还有更贵的账

OpenAI还抛出一个数字:找到这10项解法,成本不足2000美元。

按研究员Noam Brown的说法,这对应的是寻找解法所需的token费用,再依Sol API价格折算得出。

换言之,这仅是成功跑出10个解法那一刻的边际推理成本。

此外,还有Astra本身的训练研发、那些尝试未果的问题、人类将论证整理成249页论文的工时、把每个证明形式化成Lean的成本,以及最终外部数学家审查的费用。

Noam自己也承认,他们还尝试过其他重大问题但未成功,千禧年大奖难题无一拿下。

即便如此,2000美元仍将AI解开前沿难题的边际成本压至地板价。

有人甚至调侃,OpenAI明天是否会再公布10项突破,或等到下周一次发布100项。

从「互相刷榜」到「互相验货」

Fable去重做Astra同一批题,这件事比普通刷榜有趣得多。

刷榜测的是已知答案:题目和标准答案摆在那儿,比谁分高。

而两个模型在无网络、防泄漏条件下,各自独立抵达同一前沿结论,测的是完全不同的东西:结果是否可靠,能否被独立复现。

这更像同行评审。

Levent目前仅在X上「作出了声明」,并未放出那5项证明的PDF、提示词、完整运行日志、token成本或Lean证书。

网友Haider质疑:即便属实,为何要用Fable复现Astra,而非直接拿它去解新的开放问题?

事实上,Fable并非只会蹭Astra热度,它也会解新题。

7月,Levent就用Fable给出过Jacobian猜想的三维反例,事后还有人专门撰写了一份7页的代数验证材料,确认该显式映射确实推翻了三维及更高维的猜想。

绝大多数人看不懂的成果

谁来验收

这10项成果究竟有多重要,绝大多数人难以判断。

Ethan Mollick一语道破:对地球上几乎每个人而言,这不仅是超出能力,更是超出理解范围。我们只能信赖专业数学家告知其分量。

代码、图片、聊天,普通人尚能亲手体验AI强在哪。

可非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,这些只有极少数专家能读懂。

AI能力越向科学前沿延伸,公众能依靠的就越非亲身体验,而是一条长长的信任链。这种「连惊叹都无从惊叹」的状态,正越来越多领域同时发生。

数学家Thomas Bloom提醒,这些成果依托的是上百年积累的数学理论、数学家亲手搭建的形式化系统,将其简单描述为「AI取代了数学家」并不诚实。

他给出的标准是:这份证明,有没有教给我们关于这个问题的新东西?

所以真正的问题来了:当AI能低成本、批量生产前沿数学证明,我们到底该拿什么衡量其成果?

答案或许不在产出端,而在验收端:一份证明能否被读懂、被核对、被判断出分量,才最终决定其真实价值。

最稀缺的能力,正从「做出证明」转向「看懂并验收证明」。

当AI一夜之间便能证出十道难题,真正的考验才刚开始:证明越造越快,我们的验证,还追得上吗?

参考资料:

编辑:元宇

秒追ASI