数学圈和AI圈这回可是彻底搅和到了一块儿。
作者丨高允毅
编辑丨马晓宁
那种级别的原生数学硬核成果,如今已经直接砸进了大模型训练的最前线。
小红书上一位叫Z9的博主在翻文献时注意到,最近全网热议的三维挂谷猜想,已被佛罗里达大学的研究团队塞进了神经网络的训练流程里,打算用跨界手段去攻克大模型的“黑盒难题”。
他们的论文题目是《GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models》。核心思路很直接:利用挂谷猜想证明过程中衍生出的关键概念——“粘性挂谷集”,给大模型内部的语义空间定下一套“摆放规矩”。从训练一开始,就把那些缠成一团的概念理顺,让AI的思考路径真正变得可追溯。
真应了那句话:前面有数学大佬开疆拓土,后面有AI研究员捡漏寻宝。
01
大模型的底层通病:表征坍塌
咱们先从大家都深有体会的“黑盒问题”聊起。
当下的大模型,无论是做题、写代码还是做分析,正确率都相当能打。但你若追问它“这一步是怎么推出来的”,它要么含糊其辞,要么干脆编个理由糊弄你。
这问题的根子,扎在一个名为“表征坍塌”的底层特性里。
你可以把大模型的语义空间想象成一个拥有数千层货架的巨型仓库。理论上,逻辑、情感、事实、推理等无数概念都能分门别类地安放,各自占好位置。
但在Transformer训练时,模型特别爱“偷懒”。它倾向于把所有语义信息一股脑堆在仓库门口的一小块区域,剩下那90%的空间则闲置不用。
结果便是,所有概念都被挤压在一个狭窄的高维锥形区域内,学界管这叫“各向异性”。
这种拥挤状态会带来一连串麻烦。
比如,概念纠缠会让八竿子打不着的内容被硬塞进同一个方向。一个神经元可能既要响应“猫”,又要激活“圣经经文”。
更棘手的是,你根本拆不清哪部分表征对应哪条逻辑链条,连模型自身都无法还原真实的思考轨迹。
当相近但不同的概念被挤在一处,混淆便不可避免。稍微换个问法,AI就容易开始胡言乱语。
对此,论文里有句精准的总结:少数几个“流氓维度”霸占了大部分信息方差,白白浪费了模型的有效容量。
这个问题几乎是所有主流Transformer架构的通病,从GPT、Llama到Gemma,无一幸免。
面对这种困境,行业此前的解法多是“事后补救”。等模型训练完毕,再借助稀疏自编码器等工具,强行拆解那些纠缠的概念。
但这种做法拆出来的结果往往只是“看似合理”,未必对应模型内部的真实逻辑,保真度始终差一口气。
现在,GeoLAN的思路换了个赛道:别等乱了再收拾,从一开始就按规矩摆好。它在训练全程给表征空间施加几何约束,迫使每个概念各归其位。
02
挂谷猜想怎么和 AI 扯上关系?
要读懂GeoLAN的思路,得先搞懂挂谷猜想到底在说什么。
1917年,数学家挂谷宗一问了一个看似简单、却折磨数学界半个世纪的难题:拿一根1厘米长的针,在桌面上转一圈,它扫过的面积最小能有多小?
你可能觉得,转一圈总得画个圈,面积肯定小不了。但数学家发现,这个面积可以无限接近于0。
怎么做到的呢?
如果你让针一边旋转一边滑动,它竟然能扫出一个面积几乎为零的奇特图形。也就是说,在二维世界里,你可以把全方位的几何轨迹塞进一个极小的角落里。
挑战进一步升级:如果在三维空间呢?当这根针可以在上下左右、无数个立体方向上旋转,要想把这些全方向的针全部装进一个空间里,这个空间最少需要多大?
依照二维的经验,在三维空间中,这个图形的绝对体积依然可以被压缩到接近于零。
但这里冒出了新谜题:这个图形虽然空洞得没有体积,但它在微观层面是否也缩水、退化了?数学家引入了“分形维数”来衡量它的骨架密实度。
最终,王虹等人发现,即便你把图形的体积压榨得再空洞,为了照顾到每一个方向的针,它内部交织的骨架依然保持着结结实实的“三维饱满度”,在微观维度上一点都没有退化。这正是王虹终结这一世纪难题的伟大之处。
正是在这个硬核的证明过程中,诞生了一个极其关键的概念——“粘性挂谷集”。
“粘性”说白了就是一套防挤规则。它专门用来约束线段和管子,不让它们往一块儿凑。
如果一组管子遵守这套规则,它们就会老老实实铺开,空间该多大就多大;如果不守规矩,全挤在一个小角落,空间的“大小”就会缩水,看着像被压扁了一样。
看到这儿你应该能对上号了:大模型的表征坍塌,不就是“语义管子不满足粘性条件、全挤一块了吗”?
GeoLAN做的事,是直接把挂谷猜想的数学结论当作工程标准:既然数学上已严格证明“满足粘性,空间不坍缩”,那我们就给大模型的语义空间加上同款粘性约束,让它的表征天然就不会挤成一团。
要把这个规则塞进训练过程,核心是造出一个能量化的惩罚函数,也就是能让模型算得出来、知道怎么改的惩罚规则。
于是,GeoLAN设计了两套能算账的惩罚规则,将挂谷猜想里的几何规矩转化为训练目标。一个叫KT-CW,专治“语义扎堆”;另一个叫KT-Attn,专治“注意力偷懒”。
KT-CW的原理很简单:训练时随机抽查语义空间的各个方向。如果发现某个方向挤了太多语义信息,就给模型扣分。这逼着模型把知识均匀铺满整个高维空间的每个角落,把之前浪费的维度全用上,从根子上解决“挤成一团”的问题。
另一套KT-Attn则专治注意力机制的摸鱼行为。大模型的注意力头到了训练后期往往会陷入严重的同质化,很多头终日只盯着同一个词或同一个位置打转,真正有效干活的劳动力极少。这条规则强行规定每个注意力头必须关注截然不同的语义区域,确保注意力能够全方向覆盖,彻底根治了注意力头的秩坍缩现象。
这套组合拳打下来,效果立竿见影。
在Llama-3-8B上,GeoLAN硬生生把原本被挤扁的锥形表征空间揉捏成了圆润的球形,挤在一起的程度显著降低,各方向均匀性大幅提升,同时保持了任务准确率。
在 Gemma-3-4B 上,MMLU 准确率从 0.59 提升到 0.60,约提升 0.75 个百分点。TruthfulQA 的语义稳定性也得到了显著改善。
在更大体量的Gemma-3-12B上,偏见率指标也迎来了统计学层面的明显下降。
更有意思的是,论文还发现了一个叫“金凤花区”的现象。
即均匀分布这套严苛的几何约束,对于参数量太小的模型反而是一种灾难。小模型天生需要靠概念纠缠来进行极致的语义压缩,强行打散只会让内部几何结构彻底恶化。
而对于体量过大的巨无霸模型,庞大的预训练过程已经自发建立起了极其复杂的流形结构,再加这套规则,不仅水土不服,还会拖累整体性能。
只有像四到八十亿参数这样的中等体量模型,刚好拥有足够的空间来消化均匀分布带来的红利,反而效果最好。
不仅如此,论文还推导出了一个精妙的定理——“语义粘性定理”:当表征满足“防挤规则”时,不同的语义概念会自动分解为近似互相垂直的子空间,论文将其形象地称为“颗粒”。每个子空间可以独立解释、独立调整,这意味着困扰业界多年的黑盒问题就此变得透明。
一篇ACL论文,一把将挂谷猜想从纯数学殿堂拽进了AI工程。
03
菲尔兹奖得主,当天宣布加入OpenAI
另一个值得关注的细节是,在本次菲尔兹奖得主中,有一位数学大佬Jacob Tsimerman。他在获奖当天直接宣布,未来很快会入职OpenAI,从事AI安全方向的工作。
这让人们不得不正视前沿数学与AI之间日益紧密的联系。
就在一年前,他与伯克利AI安全研究者Andrew Critch合著了论文《A Taxonomy of Omnicidal Futures Involving Artificial Intelligence》,用数学家的极致严谨,为AI风险路径搭建起严密的分类体系。
他本人更是AI的重度受益者。在2025年,他有5篇数学论文上线arXiv,直言AI让自己的科研产出效率直接翻了一番。
更戏剧性的是,在颁奖前三天,有人借助Anthropic最新的Claude Fable 5,一夜推翻了悬置87年的雅可比猜想,震动全球数学界。那个人正是他的学生Levent Alpöge。
面对AI不断逼近甚至超越顶级数学家的“智商”,连数学泰斗蒂莫西公开感叹:这是他生平第一次见到大语言模型在自己完全陌生的领域,轻松攻克家喻户晓的世纪难题。
数学与AI的关系,早已过了“密不可分”这个词所能描述的范畴,它们正在以惊人的速度融为一体。
回顾过去一年AI在数学竞技场上的成绩单,从DeepMind的AlphaProof在国际奥数赛场斩获银牌,到OpenAI的推理模型一举推翻埃尔德什单位距离猜想这桩八十年悬案,再到GPT-5.6仅用一小时就搞定循环双覆盖猜想,以及Claude Fable 5一夜荡平雅可比猜想,AI在短短两个月内连续创下多项世纪纪录,而且攻坚的速度正在呈指数级加快。
在AMS访谈里,Jacob直言:“数学界存在大量‘自我安慰’,大家盯着AI现在不如数学家,就推断它永远不如数学家。”他用自己的实践证明,虽然模型的证明“不完整、不严谨”,但“通常能拉出大致正确的方法,帮你走完八成的路”。
他甚至认为,两年内,AI在数学证明这件事上,将全面超过人类。
那么问题来了:四年后的2030年菲尔兹奖,还会有人类得主吗?
菲尔兹奖有硬性年龄限制,获奖者必须未满40岁。这意味着,如果AI在未来四年内系统性超越了人类数学家的原创发现能力,评审委员会将面临一个前所未有的困境:你是在把奖颁给做出最好数学工作的人,还是颁给“人类中做出最好数学工作”的人?
更耐人寻味的,是数学与AI的双向加速。三维挂谷猜想刚被证明,三个月后就诞生了GeoLAN,纯数学成果直接落地成大模型训练工具。今天菲尔兹奖上表彰的André-Oort猜想、希尔伯特第六问题突破,明天又会演化出什么样的AI能力?
过去总说,数学家在前头拓荒,AI在后面捡宝。但现在,捡宝的那个,已经开始自己开路了。
参考链接:https://arxiv.org/html/2603.19460v1
上车,雷峰网带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
【站点差异】本稿将发布到 shixunpress.com。请换一种措辞、句式与段落节奏,避免与发往其他站点的版本雷同;事实与数字仍必须与原文一致。















