荣斋居士分享 http://blog.sciencenet.cn/u/dalianwang

博文

[转载]AI 时代的数学-陶哲轩

已有 792 次阅读 2026-7-29 06:41 |个人分类:学之心得|系统分类:科研笔记|文章来源:转载

# AI 时代的数学公开讲座,2026 年国际数学家大会(International Congress of Mathematicians 2026)Terence Tao  加州大学洛杉矶分校  2026 年 7 月 24 日> 说明:本文根据 PDF 文本层翻译整理,按原幻灯片页码保留结构;重复页脚已略去。第 51 页为空白页。## 中文译文### 第 1 页# AI 时代的数学公开讲座,2026 年国际数学家大会 2026Terence Tao  加州大学洛杉矶分校  2026 年 7 月 24 日### 第 2 页## 历史序言:基础危机几个世纪以来,数学在“朴素”的基础之上成功运行,把一些根本性问题大体交给哲学家处理,例如:- 什么是集合?- 什么是数?- 什么是无穷?- 数学的公理是什么?### 第 3 页但在 20 世纪初,罗素悖论(1901)和哥德尔不完备性定理(1931)等发现,迫使从事实践的数学家重新严格审视他们对数学基础所作的隐含假设。### 第 4 页这场基础危机(约 1900-1930 年)是数学史上一段动荡时期。但它最终产生了极其宝贵的成果:一个明确、严谨、标准化的基础框架。这个框架仍有进一步改进的空间。但我们当前的数学基础已经经受住了严格检验,是数学活动可以信赖的环境。### 第 5 页我相信,我们正在进入一个类似的动荡时期:一场关于数学价值和数学实践之基础的危机。但只要我们彻底审视并编码化这些基础,我们的共同体就会比以往更强大、更有韧性。注 1:这些幻灯片中的所有破折号都是人类生成的。### 第 6 页## 引出问题本次演讲聚焦于以下问题:**共同体回应问题**面对现代 AI 技术的出现,以及它们真实或声称具备的执行数学任务的能力,数学共同体应当如何回应?这是整个共同体都要面对的问题;我并不认为自己拥有全部答案。尽管如此,我还是有一些想法可以分享。注 2:AI 的影响当然远远超出数学领域,但这个话题过于庞大,无法在本次演讲中展开。### 第 7 页**共同体回应问题**面对现代 AI 技术的出现,以及它们真实或声称具备的执行数学任务的能力,数学共同体应当如何回应?这个问题并不是一个数学问题;它是一个元数学问题,也同时是政治、伦理和文化问题。不过,在这次演讲中,我会借用数学中精确而熟悉的语言,来澄清我今天想表达的观点。### 第 8 页## 第一个子问题:AI 能力这个问题的答案,关键取决于下面这个子问题。我会用一种拟数学的方式,把它表述成一个猜想,或者更准确地说,是一组猜想:**AI 能力猜想(模板)**在不久的将来,某些 AI 工具将在某种成本下、在某种程度的人类监督下,能够在某些数学领域中完成某些研究级数学任务,并达到某种非平凡的成功率,以及某种正确性和质量水平。这里反复出现的“某种”,应当被看作占位符,或者说“变量”。### 第 9 页**AI 能力猜想**在不久的将来,某些 AI 工具将在某种成本下、在某种程度的人类监督下,能够正确完成某些数学领域中的某些研究级数学任务,并达到某种非平凡的成功率,以及某种正确性和质量水平。根据如何填入这些占位符,可以形成这个猜想的许多不同版本。这些版本之间的细微差别,并不是我今天演讲的重点。我这里只作一个粗略区分:这个猜想的“弱形式”和“强形式”。### 第 10 页如果连 AI 能力猜想的弱形式都是假的,那么我们就可以放心地把 AI 工具视为没有长期重大意义,并且基本上照常行事。但如果这个猜想的最强形式为真,那么维持我们当前的文化和实践就会变得困难,尤其是当我们把“尽可能多地解决未解问题”这类目标放在优先位置时。### 第 11 页当 AI 能力猜想的状态仍有争议时,很难围绕“共同体回应问题”展开建设性讨论。因此,许多关于 AI 与数学的争论,都集中在 AI 能力猜想的哪些版本为真这一问题上。我本人也已经用许多讲座、文章和社交媒体帖子讨论过这些主题。### 第 12 页现在,支持或反对 AI 能力猜想各种形式的证据点已经很多。但其中大多数并不是在受控科学条件下获得的。特别是,许多公开可见的证据都高度受到报告偏差和非科学激励的影响,一些重要成本和变量也没有披露。此外,我们必须区分某一版本猜想的真值,与它是否值得期待。### 第 13 页尽管 AI 能力猜想与“共同体回应问题”高度相关,但我的演讲并不是关于这个猜想本身。在这个方向上,我只会提到 First Proof 挑战赛(1stproof.org)的最新结果。### 第 14 页## First ProofFirst Proof 是对前沿 AI 模型和工具链状态的一项独立评估。每一“批次”包含十个来自不同领域的全新研究级问题。第二批问题于 2026 年 5 月 28 日在受控科学条件下,对四套 AI 工具链进行了测试。结果由专家从正确性和表述质量两个方面进行评审。十个问题中,有七个被至少一个团队以达到发表水平的质量解决。每个问题的算力成本在 10 至 1000 美元之间。更多“批次”计划在不久的将来继续进行。### 第 15 页## 能力猜想的补空间本次演讲讨论的,是“共同体回应问题”中相对于 AI 能力猜想的“正交补”。因此,接下来的演讲将基于以下表述并不精确的假设:**工作假设**AI 能力猜想的一个相当强的版本为真:在相当近的将来,AI 工具将能够以合理的成功率、质量、监督水平和成本,完成相当比例的研究级数学任务。“合理”的精确定义,对本次演讲并不关键。### 第 16 页**工作假设**在相当近的将来,AI 工具将能够以合理的成功率、质量、监督水平和成本,完成相当比例的研究级数学任务。在接下来的演讲中,我会请大家假定这个工作假设成立。我并不是要求你们希望、相信或接受这个假设为真。这只是一个条件分析。支持或反对工作假设的证据,与我接下来要讨论的问题是正交的。### 第 17 页## 正交的子问题:我们的目标和价值一旦我们以工作假设为条件,另一个根本性的子问题就会显现出来。**目标与价值问题**我们的数学共同体,以及数学研究事业,究竟有哪些精确的目标、目的和价值?不仅包括我们向公众或资助机构说明的显性目标,也包括我们在实践中实际追求的隐性目标。### 第 18 页**目标与价值问题**我们的数学共同体,以及数学研究事业,究竟有哪些精确的目标、目的和价值?过去,我们大体上把这个问题交给人文学科处理,而把注意力集中在职业的技术层面。如果工作假设成立,我们将不再拥有这种奢侈。不过我认为,对这个问题进行批判性审视,最终都会非常有价值,无论工作假设是否成立。### 第 19 页## 我们的目标是什么?为数学研究辩护有很多理由。仅举几例:- 解决未解问题,包括纯数学和应用数学问题。- 发展新的理论和技术。- 理解我们周围的世界。- 建设数学家共同体。- 培养下一代数学家,使其能够引导未来方向。- 为数学知识的共享网络作出贡献。- 创造具有持久审美价值的作品。- 等等。### 第 20 页过去,这些目标之间大体上呈正相关:一个目标上的进展,通常也会带来其他目标上的进展。因此,人们可以用其中一两个目标作为其他目标的代理指标。很多目标也就可以只保持隐含状态。图示:数学知识、目标 1、目标 2。### 第 21 页然而,所有指标一旦被过度优化,都有陷入古德哈特定律的风险:**古德哈特定律(1975)**当一个度量指标成为目标时,它就不再是一个好的度量指标。生成式 AI 本身缺乏扎根性的性质,以及 AI 公司的财务激励,使 AI 工具的使用尤其容易受到这一定律影响。图示:数学知识、目标 1、目标 2。### 第 22 页过度的 AI 优化事实上可能导致数学中许多原本大体一致的目标彼此分化。图示中列出了一些可能分化的方向:数学知识、解决研究问题、解决厄多什问题、解决奥赛问题、建设理论、应用知识、建设共同体、培养下一代、创造持久的审美作品。注 3:这个图示极度简化;尤其是,它本应是高维得多的。### 第 23 页## 案例研究:解题在本次演讲中,我会用数学研究中的“解题”部分来说明这一点。我会强调,这并不是我们职业的唯一方面。例如,理论建设是与解题互补的重要方面,需要单独分析。不过在工作假设成立的情况下,解题似乎尤其容易受到影响。图示:数学知识,解决研究问题。### 第 24 页假设我们指定如下目标:**目标(第一次尝试)**尽可能多地解决未解问题。我们现在试图优化以下网络中的流:开放问题 -> 证明生成 -> 解答### 第 25 页即使在 AI 出现之前,我们也已经知道优化这个指标存在重大风险:人们会看到大量关于重大开放问题的错误解答,例如黎曼猜想。### 第 26 页因此,我们可以更新目标:**目标(第二次尝试)**尽可能多地解决未解问题,并验证它们是正确的。开放问题 -> 证明生成 -> 未验证解答 -> 证明验证 -> 已验证解答### 第 27 页AI 和自动形式化方面的进展,也就是使用 Rocq、HOL 或 Lean 等证明助手语言的进展,已经在许多情况下显著加速了证明生成和证明验证。如果工作假设成立,这种加速还会继续增强。但如果一个 AI 工具生成了一篇很长的证明,而没有人理解它,甚至连提示 AI 的原本人类也不理解,那该怎么办?注 4:形式化这个话题本身需要一整场讲座,这里不展开。### 第 28 页现在,专门面向数学问题的网站,例如 https://www.erdosproblems.com,已经包含数十份 AI 生成的证明投稿。其中很多可能是正确的,但还没有人类专家自愿去验证并为它们背书。在几个案例中,甚至连人类投稿者自己也声明没有资格这样做。我们是否可能拥有一个重要结果的已验证证明,但没有任何人类理解到足以解释它?注 5:蓬勃发展的在线数学共同体的出现,是另一个重要主题,本次演讲无法展开。### 第 29 页我们可以更新目标,提升阐释的作用:**目标(第三次尝试)**尽可能多地解决未解问题,验证它们是正确的,并确保这些结果能够被数学共同体清楚交流和理解。开放问题 -> 证明生成 -> 未验证解答 -> 证明验证 -> 已验证解答 -> 证明阐释 -> 写得清楚的解答### 第 30 页当前 AI 工具在证明阐释方面的表现非常参差。一方面,拼写、语法和格式几乎无可挑剔。然而,它们的写作往往在平凡之处铺陈过长,却在论证中最有趣、最新颖的部分写得很短,甚至遮蔽这些部分。AI 生成的文本也常常没有说明与既有文献的联系,或者没有提供结果的高层概览。注 6:也可以说,它们有些过于无可挑剔。### 第 31 页相较于证明验证,证明阐释是一个更“模糊”的优化目标。但工作假设预示,AI 工具很快就能在当前水平之上提升证明阐释能力。然而,即使是阐释也可能被过度优化。一篇证明可能会变得写得过于顺滑:论证中的常规部分和困难部分都被呈现得同样容易消化。### 第 32 页在人类撰写的证明中,作者当初感到困难的论证部分,通常会保留某种自然阻力,提示读者放慢速度、投入更多注意力。一篇被 AI 过度润色的证明,可能会同时去除“人为的”和“自然的”阻力,却没有真正鼓励读者学习和理解论证中的关键思想。看似矛盾的是,人类阐释中的“错误”最终可能反而有助于读者。### 第 33 页Bourgain 1991 年的一篇论文,上面有年轻得多的我所作的注释。### 第 34 页William Thurston,《论数学中的证明与进步》(1994)“我们并不是在努力满足某种抽象的定义、定理和证明的生产配额。衡量我们成功与否的标准,是我们的工作能否使人们更清楚、更有效地理解和思考数学。”### 第 35 页一篇证明若要真正对更广泛的领域作出贡献,仅仅正确且易读是不够的。它还需要被共同体接受和重视。其他数学家需要消化这个结果,并把它纳入自己的工作。### 第 36 页作者可以通过描述自己解决问题时的洞见和经历,帮助共同体完成消化过程。然而,当前 AI 工具对其解题过程相当不透明。对于内部机制仍属于公司机密的专有模型来说,这一点尤其如此。### 第 37 页**目标(第四次尝试)**解决未解问题,验证它们正确,确保它们被清楚交流,并使其被数学共同体消化和接受。开放问题 -> 证明生成 -> 未验证解答 -> 证明验证 -> 已验证解答 -> 证明阐释 -> 写得清楚的解答 -> 证明发表 -> 被接受的解答### 第 38 页共同体对一个结果的接受,就其本性而言,是缓慢的、人的过程。良好的阐释和细致的写作可以促进这个过程。但它最终是一个外部过程,不能仅仅由作者及其 AI 工具来优化。### 第 39 页我们当前的出版基础设施依赖人类编辑和审稿人自愿提供这种共同体接受服务。这项工作常常被认为不如最初生成证明那样有声望。但它是我们职业中不可或缺的组成部分。它也是我们把数学家的个人成就转化为集体进步和共同理解的方式。### 第 40 页AI 评估工具可以作为共同体接受过程中的有用过滤器。例如,期刊可以自动拒绝那些被标记为验证不足或阐释不足的论文。但这类工具不能完全替代共同体接受。### 第 41 页事实上,即使一篇证明已经发表,也并不总是一个解答的最终状态。关键结果最终应当成为该学科权威教材和参考材料的一部分,并被教授给下一代学生。### 第 42 页这种对证明的经典化,是所有阶段中最慢的。它需要共同体形成广泛而审慎的共识。这是最不适合由 AI 工具优化的阶段。但它也是整个过程中最有价值的部分。许多应用只有在其底层数学被充分消化之后才变得可行。例如,AI 工具在数学中的成功,关键依赖于人类数学家几个世纪以来辛苦建立的经典理论。### 第 43 页**目标(最终尝试?)**解决未解问题,验证它们正确,确保它们被清楚交流,并使其被消化、接受,最终纳入该领域的权威理论之中。开放问题 -> 证明生成 -> 未验证解答 -> 证明验证 -> 已验证解答 -> 证明阐释 -> 写得清楚的解答 -> 证明发表 -> 被接受的解答 -> 证明消化 -> 证明经典化 -> 权威解答### 第 44 页如果工作假设成立,那么在缺乏适当政策和文化变化的情况下,这一过程的各个环节都会出现显著的“阻抗不匹配”,或者说“证明消化不良”:- AI 生成的证明会不断积压,等待验证。- 许多已验证的 AI 生成证明会等待可读的写作版本。- 即便要求 AI 生成的证明正确且写得清楚,它们也会压垮传统同行评审系统。- 即便已经发表的证明,也会多到共同体来不及将其整理成权威形式。简言之,我们将从一个“证明稀缺”的时代,转向一个“证明丰裕”的时代。这种消化不良的迹象已经开始出现;事实上,压力在现代 AI 到来之前就已经显现。### 第 45 页## 从目标到建议识别解题活动的目标,有助于我们理解如何回应这些正在出现的阻抗不匹配。莱顿宣言 https://leidendeclaration.ai 是这方面一个很好的起点。Jim Portegies 将于 7 月 26 日就此作一场讲座。### 第 46 页评论:我们需要避免最坏情形,即作者暗中使用 AI 工具辅助自己的工作,却为了避免同行批评而隐瞒这种使用。应当使负责任地披露 AI 协助成为常态。注 7:这些幻灯片中使用了 AI 工具来自动补全文本和生成图表。### 第 47 页评论:我们需要降低对证明生成、对“第一个”解决问题的强调;并提高对“证明消化”的重视,包括阐释、发表和经典化。### 第 48 页评论:我建议的经验法则是:如果作者不能令人信服地证明自己可以就其结果作一场清楚的、专家级的报告,并且报告内容正确、归属恰当,那么这个结果就不应发表。### 第 49 页## 结语我把解题作为数学中的一个方面来讨论,在这个方面,工作假设迫使我们审视自己的目标和价值。但工作假设还可能影响我们工作的许多其他方面:教学、指导、招聘、基金申请、公众传播,等等。我们也应当对这些方面进行类似分析。### 第 50 页在许多领域,尤其是教育和训练中,强调我们工作的人的方面,并严格限制 AI 工具的使用,将会至关重要。在另一些领域,我们则需要主动开展 AI 使用,并按照我们自己的条件来定义把这些工具纳入工作流程的最佳实践。我们还需要新的工作流程和新的基础设施,来补充传统流程和基础设施;不过那是完全不同的一场演讲,我今天不展开。我们的共同体需要团结起来,就 AI 能力以及我们的目标和价值展开开放而诚实的讨论。### 第 51 页空白页。### 第 52 页## 一些新的工作流程和基础设施- Mathlib: https://mathlib.org/- Mathematical Discourse: TBA- Erdős problems: https://www.erdosproblems.com- Optimization constants database: https://github.com/teorth/optimizationproblems- SAIR Competitions: https://competition.sair.foundation/competitions感谢 Bryna Kra、Jeremy Avigad、Martin Hairer、Akshay Venkatesh 和 Emily Riehl 对本次演讲早期版本提供反馈。## 总结与归纳:这份 PDF 的核心启示### 1. 这不是一场关于“AI 到底多强”的演讲,而是关于“如果 AI 足够强,我们怎么办”Tao 把问题拆成两层:第一层是 AI 能力猜想,即 AI 是否能以合理成本、合理监督和合理质量完成研究级数学任务;第二层才是本演讲重点,即一旦这个猜想的强版本成立,数学共同体的目标、价值和制度应如何调整。这一区分很重要:AI 能力是否真实,与这种能力是否值得期待,不是同一个问题。即便某种能力真实存在,共同体仍然需要决定如何规范它、吸收它、限制它或重塑制度来应对它。### 2. 数学正在经历的不只是技术冲击,而是“价值和实践基础”的危机Tao 用 20 世纪初数学基础危机作类比:罗素悖论、哥德尔不完备性定理等事件迫使数学家重新审视“什么是数学基础”。AI 时代则迫使数学家重新审视“数学活动到底追求什么”。过去很多目标之间大体一致:解决问题、发展理论、培养人才、建设共同体、贡献知识网络、创造审美价值,常常相互促进。AI 的大规模优化能力可能打破这种一致性,使某个指标被过度追求,从而让其他目标受损。### 3. 最大风险不是 AI 不能生成证明,而是“证明太多以后如何消化”演讲最关键的转换,是把问题从“证明生成”推进到完整链条:开放问题 -> 证明生成 -> 证明验证 -> 证明阐释 -> 共同体接受 -> 证明消化 -> 经典化如果 AI 能大量生成研究级证明,数学将从“证明稀缺”进入“证明丰裕”。真正的瓶颈会转移到验证、写作、审稿、理解、教材化和理论整合上。这对数学共同体是根本挑战:原有同行评审体系建立在证明相对稀缺的前提上,不一定能承受 AI 生成证明的大量涌入。### 4. “正确”不是数学成果的终点Tao 强调,一个证明即使正确、易读,也不必然已经对领域作出贡献。它还需要被共同体接受、被其他数学家消化、被纳入后续研究,最终成为教材和参考材料中的权威知识。这给出一个非常重要的知识观:数学不是单个证明的堆积,而是共同体将结果转化为可理解、可传承、可复用知识的过程。### 5. 过度优化会触发古德哈特定律如果把“解决未解问题的数量”作为核心目标,AI 可能推动大量错误证明、没人理解的证明、没人愿意审查的证明、或者形式上很漂亮但遮蔽关键思想的证明。这正是古德哈特定律的典型情形:当某个指标成为目标,它就不再是好指标。数学研究不能只按“解决了多少题”“第一个证明了什么”来衡量。### 6. 人类的“摩擦”有时是理解的一部分演讲中很有意思的一点是:人类证明中的不完美,有时能帮助读者识别哪里困难、哪里需要放慢速度。AI 过度润色可能把困难部分和常规部分都写得同样顺滑,反而削弱学习效果。这说明“清楚表达”不是把所有文字打磨到无摩擦,而是要帮助读者抓住论证中的结构、难点、来源和核心思想。### 7. 透明披露 AI 协助应成为规范Tao 明确提出,要避免作者偷偷使用 AI 又因为担心批评而隐瞒。负责任披露 AI 协助应当常态化。这意味着未来数学论文、报告和审稿制度可能需要更明确的 AI 使用声明:AI 用于补全文字、生成图表、检索文献、形式化证明、提出思路,还是直接参与证明生成,这些应当区分清楚。### 8. 评价重心需要从“谁先证明”转向“谁能消化和解释”演讲最具实践性的建议是:降低对证明生成和“第一个解决问题”的强调,提高对证明消化的重视,包括阐释、出版、审稿、经典化和教学转化。Tao 给出的经验法则很直接:如果作者不能清楚、正确、归属恰当地作一场专家级报告,那么结果就不应发表。换句话说,作者不仅要拥有一个证明,还要能承担解释、归属和共同体沟通责任。### 9. 教育和训练领域尤其需要保留人的部分在教育和训练中,AI 使用不能只看效率。数学训练的价值不只是得到答案,而是训练判断、耐心、抽象能力、错误修正能力和表达能力。因此,在教学、 mentoring、招聘、基金申请、公众传播等场景中,需要分别分析 AI 会优化什么、扭曲什么、替代什么、不能替代什么。### 10. 这份 PDF 给非数学领域的普遍启示虽然演讲聚焦数学,但它的框架适用于很多知识行业:- 先区分“AI 能不能做”与“AI 做了以后是否好”。- 不要只优化最容易量化的指标。- 生成能力提升后,瓶颈往往转向验证、解释、吸收和制度承载。- 知识工作的价值不只在产出数量,还在共同体理解、信任、传承和复用。- AI 应进入工作流,但应按共同体自己的目标进入,而不是由工具和平台的激励来定义目标。## 一句话总括这份 PDF 的核心不是“AI 会不会做数学”,而是:如果 AI 真的能大量做数学,数学共同体就必须重新定义什么才算有价值的数学进步,并把制度重心从“生成证明”转向“验证、解释、消化、接受和经典化”。



https://blog.sciencenet.cn/blog-2089193-1545575.html

上一篇:PowerPoint安装IguanaTex方法




    
收藏 IP: 183.241.34.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (1 个评论)

数据加载中...
扫一扫,分享此博文

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-9-3 17:38

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部