AI产业链 当 AI 把证明变成廉价商品,数学最稀缺的能力才刚刚浮出水面
信源:a16z|Lisha Li 对话多伦多大学数学家 Daniel Litt|Can AI Learn Mathematical Intuition?|2026-09-01
“数学的目标不是生产论文,而是获得理解。”Daniel Litt 在访谈中的这句话,点出了当前 AI 数学能力最容易被误读的地方。AI 已经开始解决真正的开放问题,但这并不等于它已经掌握了数学家的全部工作。更准确地说,数学正从“证明稀缺”进入“证明过剩”:符号推导、技术组合和大规模搜索迅速降价,新的瓶颈转向了提出什么问题、选择什么表述、如何建立理论,以及如何判断一个结果是否真的增进了理解。
这里的“数学直觉”并不是神秘灵感。它是一组可以观察的能力:从大量现象中选出值得研究的变量,把模糊感觉压缩成正确命题,在不同领域之间建立类比,并从一个证明中抽取能够解释更多问题的结构。证明回答“这个命题是否成立”,直觉决定“为什么要研究这个命题,以及应该以什么形式研究它”。当前模型在前一类任务上的进步,明显快于后一类。
不能因此低估 AI。2026年5月,OpenAI 的内部通用推理模型自主推翻了 Erdős 单位距离猜想:它把代数数论中的工具引入离散几何,构造出单位距离数量呈多项式改善的无限点集。原始论证由模型一次性产生,之后由人类数学家整理、简化和验证。OpenAI 官方材料与数学家联合撰写的评注都确认,这不是把最后几步补完,而是一次出乎领域共识的跨学科构造。它随后还启发了实数域 sum-product 猜想等问题的新进展。
但这个案例同时暴露了 AI 的优势来自哪里。模型拥有近乎百科全书式的知识,不会疲劳,可以同时尝试大量人类认为成功率过低的路线。OpenAI 8月公布的十项数学和理论计算机成果,寻找解法所需 token 按公开 API 价格计算约为2000美元,之后全部生成了 Lean 形式化证书。这已经很像一条数学证明生产线。
Anthropic 的黎曼 ζ 函数结果把这种生产方式展示得更加彻底:Claude 先尝试了650个想法,随后用约3100万输出 token、60个子代理、2400次 shell 命令和数百个 Python 脚本,把临界线上简单零点的无条件下界从41.6%提高到67.2%,并完成交叉审查和 Lean 验证。Anthropic 公布的过程说明,AI 数学的当前核心能力,是把搜索宽度、持续运行时间、工具调用和验证机制组合成一个研究系统。
然而,子代理数量并不等于认知多样性。几十个代理可以探索几十条路线,却仍可能共享相似的训练分布、问题表述和“什么看起来值得尝试”的先验。如果把同一个数学家复制一千次,计算量增加了,学术共同体原本由不同审美、经验和好奇心形成的高维探索空间,却未必同步扩大。
Litt 在视频里举了一个很准确的例子:他曾有一个模型无法证明的引理,自己计算大量实例后,重新找到了一个更好的命题表述;一旦表述正确,Gemini 很快就完成了证明。后来更强的模型也能直接给出原命题的十页暴力计算,但那个证明没有解释为什么命题成立,也不会自然导向更一般的理论。
这就是“完成证明”和“产生理解”的差别。暴力证明可以关闭一个问题,好的表述却能打开一片问题。
验证也正在成为新的稀缺资源。短而巧的证明容易审查,数百页 AI 生成论文即使每一行看起来合理,也可能没有任何人真正理解其全局结构。人类专家检查长证明时,通常不是机械地逐行重算,而是判断结论是否强得反常、论证能否错误地推出已知反例、特殊情形是否成立。模型擅长局部推导,却仍不稳定地掌握这种“全局单元测试”。Lean 能证明形式推导有效,却不能自动回答结果是否新颖、重要,或者它是否改变了我们理解问题的方式。
因此,AI 对数学界近期最大的冲击,可能不是取代数学家,而是击穿现有评价体系。Litt 在视频中说,他让 Codex 自行寻找代数几何猜想并尝试证明,一个小时就得到三篇“正确但很差”的论文。如果职位、声望和经费仍然奖励论文数量,最理性的行为就会变成反复拉动模型这台老虎机。论文数量增长,反而可能伴随有效知识密度下降。
最有力的反驳是:理论构建也许只是暂时落后。Litt 本人并不认为能力会停滞;Claude 在挑战黎曼猜想失败后意外找到重要下界,也说明大规模搜索能够涌现出未被直接指定的发现。因而,直觉未必是模型无法跨越的天花板,更可能是训练目标和研究 harness 尚未覆盖的能力。
下一阶段竞争的重点,由此不会只是模型能解多少道题,而是谁能构建更好的“发现系统”:奖励新的问题表述、可迁移的方法和彼此独立的研究路线;同时具备形式验证、全局压力测试、来源追踪和人类可理解性。一个只会输出更多证明的系统,可能只是让数学家更忙;能够把证明转化为新概念、新问题和新理论的系统,才真正接近数学研究。
检验这条边界是否被突破,关键不是再看一次开放问题排行榜,而是观察 AI 能否自主提出被专家采用的新定义和新猜想,并由此连续解决一族问题。当模型开始创造可供人类继续工作的理论框架,数学直觉才算真正进入机器内部。在那之前,AI 首先工业化的是证明,而人的价值正在从计算迁移到选题、解释与意义。