AI辅助整理:本文基于下方列出的公开原始来源改写,不代替原文。
核心摘要: Anthropic宣布Claude产出费马大定理的首个端到端、由计算机验证的完整证明:在11天里基本自主用Lean语言写成约1300万行代码,过程中证明约3万个中间定理(最终证明使用约2.95万个)。数十个Claude智能体通过开源的Prove2Me协作平台分工推进,整体消耗约60亿输出token。经Lean校验、仅依赖其三条标准公理,并由帝国理工的Kevin Buzzard审阅。该成果被Anthropic视为AI辅助形式化验证数学的一次里程碑。
事件概述
2026年9月4日,Anthropic宣布Claude产出费马大定理的首个端到端、由计算机验证的完整证明:在11天里基本自主用Lean语言写成约1300万行代码。
数十个Claude智能体通过开源的Prove2Me协作平台分工推进,整体消耗约60亿输出token。证明经Lean校验、仅依赖其三条标准公理,并由帝国理工的Kevin Buzzard审阅。
业务背景与问题
费马大定理是人类数学史上最著名的难题之一,人类首个完整证明1995年才由Wiles完成,而“把整条证明形式化成机器可逐行校验”此前被认为要耗时数年。
传统AI在长链条、易出错的复杂推理任务上往往难以保持一致性,形式化验证则要求每一步都严格可校验,这对AI的自主长程推理能力提出了极高要求。
AI如何落地
Anthropic采用“Claude+多智能体框架+Prove2Me协作平台”的方式:数十个Claude智能体分工推进,通过协作平台维护任务图谱,把复杂长链任务拆成有依赖关系的子任务,以缓解模型记忆衰减。
过程中Claude证明约3万个中间定理(最终证明使用约2.95万个),证明体量超过主流数学库Mathlib的5倍。
实施步骤
Anthropic将Prove2Me协作平台开源,供外部研究者和开发者使用。
官方还透露,用三个个人级Claude Max订阅协作,团队3天就形式化完成了Vinogradov三素数定理,说明这种协作式形式化在消费级预算下也能推进。
Anthropic同时扩大了对外部数学家(纯数学与形式化方向)的免费/折扣订阅与科研资助。
结果证据与边界
证明经Lean校验、仅依赖其三条标准公理,并由帝国理工的Kevin Buzzard审阅,这是其可信度的核心证据。
结果与规模均由Anthropic自身披露,外部独立复现与更广泛落地仍在早期。
可复制动作
技术团队与科研组织可引入“证明助手/形式化工具+多智能体分工”的做法,把复杂长链任务拆成有依赖关系的子任务,用协作平台维护任务图谱。
把“机器可验证的证据”作为高正确性要求的AI产出的标配,而非只信模型自述;先在小而边界清晰的任务上验证多智能体协作的稳定性,再放大规模。
证据与边界
- Claude在11天内基本自主用Lean语言写成约1300万行代码,证明约3万个中间定理(最终证明使用约2.95万个)。
- 数十个Claude智能体通过开源的Prove2Me协作平台分工推进,整体消耗约60亿输出token。
- 证明经Lean校验、仅依赖其三条标准公理,并由帝国理工的Kevin Buzzard审阅。
- 官方称证明体量超过主流数学库Mathlib的5倍。
- 结果与规模均由Anthropic自身披露,外部独立复现与更广泛落地仍在早期。
企业今天可以做什么
可复制动作面向技术团队与科研组织:一是引入“证明助手/形式化工具+多智能体分工”的做法,把复杂长链任务拆成有依赖关系的子任务,用协作平台(如Prove2Me)维护任务图谱以缓解模型记忆衰减;二是把“机器可验证的证据”作为高正确性要求的AI产出的标配,而非只信模型自述;三是先在小而边界清晰的任务上验证这种多智能体协作的稳定性,再放大到更大规模;四是关注实验室开放的外部研究员资助与订阅渠道,低成本试探能力边界。