2026年8月10日,Anthropic发布了一篇研究博客,标题平淡无奇——《关于Claude数学能力的更多发现》。但内容却让数学界炸开了锅:一个尚未发布的研究版Claude,在尝试攻克黎曼猜想的过程中,将临界线上零点比例的长期下界从41.6%提升到了67.2%。
这不是一个"AI帮人类算了一道题"的故事。这是一个AI在人类最古老、最深刻的未解难题上,独立完成了可验证数学突破的故事。
黎曼猜想,1859年提出,2026年依然悬而未决。它被称为"猜想界的皇冠",悬赏百万美元。167年来,无数最聪明的头脑前赴后继,只留下碎片化的进展。而现在,一个AI模型把其中一个下界从41.6%推到了67.2%——这是一个真实、可验证、有数学价值的进步。
黎曼猜想的核心是:黎曼ζ函数的所有非平凡零点都位于复平面上实部为1/2的"临界线"上。虽然计算机已验证超过10¹³个零点全部位于这条线上,但严格证明至今无人完成。
Claude并没有证明黎曼猜想本身。但它做了一件真正困难的事:证明了至少67.2%的非平凡零点位于临界线上——而此前的最佳下界是41.6%。这个提升听起来不大,但在数学上,从41.6%到67.2%是一个实质性的进步,意味着更多零点被严格约束在了临界线上。
这次研究的背景很特别。Anthropic员工Jarred Sumner将黎曼猜想作为挑战任务交给了Claude。模型经历了650次失败尝试后,并没有放弃——它在Claude Code环境中协调了约60个子级智能体,累计执行了2400条Shell命令,编写了数百个Python脚本,生成了3100万个输出Token。
Claude的方案结合了Balujoyt、Goldston、Suriyajah、Turecki-Bartbo和Bongeiri等数学家的既有研究框架。它构造了一个合适的函数空间,在其中引入由韦伊诱导的二次型,利用一阶矩和二阶矩信息建立二次型秩的不等式。关键一步是将整个空间统一处理,同时纳入正定和负定部分,并允许二次型采用非对角形式。
Anthropic随后请内部数学家莱文特·阿尔波格和拉尔夫·弗曼验证结果,并交由外部数论专家布莱恩·康雷和丹·戈德斯顿审阅。员工埃里克·伊斯利还将证明写成了可由Lean验证的形式。
Claude在这次研究中展现的能力,与传统数学证明有本质区别,也与早期AI辅助工具(如AlphaProof)不同。
传统自动定理证明系统(如Lean、Coq)需要人类提供完整的证明骨架,AI只是在填充细节。而Claude这次做的是:它自主提出了新的研究方向,自主选择了技术路线,自主完成了计算和验证。
这背后是三层能力的结合:
第一层,跨领域联想。 Claude同时调用了数论、复分析、代数几何等多个领域的知识。数学研究的一个重要特点是:突破性进展往往来自不同领域的交叉。AI的优势在于无隔联结——每个概念、每个定理之间都可以无缝链接,没有人类研究者的"领域偏见"。
第二层,多智能体协作。 Claude在Claude Code中协调了60个子智能体,分别负责找思路、做计算、查反例、审证明、写论文。这是一种去中心化的研究模式,每个子代理专注一个子任务,主代理负责整合。这种模式更接近真实数学研究的协作方式,而非传统的"一个人+一支笔"。
第三层,形式化验证。 证明完成后,Claude将其转化为Lean形式化语言,实现了机器可验证。这不是简单的代码转换——Lean要求每一步推导都有严格的逻辑依据,任何漏洞都会被立即发现。AI输出的内容必须通过这一关,才算有效。
Claude的这一突破,意义远超一个数学下界的提升。它标志着数学研究正在经历一场静悄悄的范式革命。
从"手工艺"到"规模化"。 陶哲轩曾形容,传统数学研究像是"手工艺"——一个数学家花数年甚至数十年攻克难题。AI正在将数学研究推向"规模化":多智能体协作、自动化验证、大规模计算探索,让研究效率呈指数级提升。
从"个人英雄"到"人机协同"。 数学史的叙事一直是"某个天才解决了某个问题"。但AI时代的数学研究,更像是人类数学家与AI系统的协作过程:人类提出方向、判断价值、引导策略,AI执行计算、验证细节、探索可能性。这不是取代,而是增强。
从"直觉驱动"到"数据驱动"。 传统数学研究依赖数学家的直觉和灵感,AI则引入了数据驱动的研究方式:通过大规模实验发现模式,通过反复试错找到方向。这种"实验数学"的方式,正在成为第三支柱——在纯理论和纯计算之间,开辟了新的研究路径。
但这并不意味着AI已经"掌握"了数学。陶哲轩在访谈中明确指出,AI目前在数学领域的能力就像"一个有时不太可靠、但能力超群的研究生"——它能完成具体任务,但在高复杂度证明中仍需人类深度引导。Claude在黎曼猜想上的成功,恰恰是因为它没有试图证明整个猜想,而是找到了一个合适的子问题,在这个问题上实现了突破。
2026年8月11日,当这条新闻在科技圈引发狂欢时,我看到的却是更多的问号。
首先,这个结果的重要性被过度放大了。 41.6%到67.2%,在数学上是一个真实进步,但距离"证明黎曼猜想"(100%)还有极其漫长的路。更关键的是,这个突破依赖的是前人建立的框架——Balujoyt、Goldston、Suriyajah等人的工作。AI的"创新"是在已有道路上的推进,而非开辟新路。
其次,多智能体协作的成本问题。 60个子代理、2400条Shell命令、3100万Token、650次失败尝试——这种"暴力穷举"式的研究方式,在算力成本上完全不可持续。如果每次数学突破都需要这样的资源投入,AI数学研究将止步于少数顶级实验室。
第三,数学的本质是"理解"而非"证明"。 AI可以给出正确的证明,但它不理解为什么这个证明是"优雅"的、为什么这个问题如此重要、为什么解法如此巧妙。数学研究的价值不仅在于结论,更在于过程中的洞察。当AI取代了人类的过程,我们得到的是一套"正确的答案",却可能失去"有意义的数学"。
但即便如此,这场革命仍然不可逆转。 Claude在黎曼猜想上的突破,无论大小,都是一个信号:AI正在从"工具"进化为"合作者"。未来的数学研究,将不再是"人类vs AI"的零和博弈,而是两者协作的新范式。
我们不必担心AI会"取代"数学家——就像计算器没有取代数学家一样。但我们必须接受:数学研究的方式、节奏、合作模式,都在发生深刻的变化。
2025年,OpenAI的内部推理模型自主推翻了埃尔德什的"单位距离猜想";2026年初,Google DeepMind的AlphaProof Nexus解决了9道Erdős难题;2026年8月,Claude将黎曼猜想的零点下界从41.6%提升到67.2%。
这不是孤立事件。这是一个趋势的加速——数学的AI拐点,已经到来。
未来的数学家,可能不再"独自坐在书桌前",而是与AI系统并肩工作:人类提出方向、判断价值、引导策略,AI执行计算、验证细节、探索可能性。数学研究将从"个人英雄时代"进入"人机协作时代"。
黎曼猜想,这个困扰人类167年的世纪难题,也许永远不会被某个AI单独证明。但Claude的这次突破告诉我们:我们已经不再是167年前那个只能靠人类大脑硬啃的时代了。
数学,正在成为AI的第一个"非计算"战场。而这场革命,才刚刚开始。
未公开的新模型"立功",Anthropic 宣布 Claude 攻克黎曼猜想取得重大突破 - IT之家
An unreleased Anthropic model made progress on one of math's biggest unsolved problems - TechCrunch
黎曼猜想 - 维基百科
Learning more about Claude's mathematical capabilities - Anthropic Research