AI News · AI新情报

Anthropic让Claude用Lean完成费马大定理首个机器可验证证明:11天自主产出1300万行

Anthropic宣布Claude产出费马大定理的首个端到端、由计算机验证的完整证明:在11天里基本自主用Lean语言写成约1300万行代码,过程中证明约3万个中间定理(最终证明使用约2.95万个)。数十个Claude智能体通过开源的Prove2Me协作平台分工推进,整体消耗约60亿输出token。

Anthropic让Claude用Lean完成费马大定理首个机器可验证证明:11天自主产出1300万行
AI辅助整理:本文基于下方列出的公开原始来源改写,不代替原文。

核心摘要: Anthropic宣布Claude产出费马大定理的首个端到端、由计算机验证的完整证明:在11天里基本自主用Lean语言写成约1300万行代码,过程中证明约3万个中间定理(最终证明使用约2.95万个)。数十个Claude智能体通过开源的Prove2Me协作平台分工推进,整体消耗约60亿输出token。经Lean校验、仅依赖其三条标准公理,并由帝国理工的Kevin Buzzard审阅。该成果被Anthropic视为AI辅助形式化验证数学的一次里程碑。

事件概述

2026年9月4日,Anthropic宣布Claude产出费马大定理的首个端到端、由计算机验证的完整证明:在11天里基本自主用Lean语言写成约1300万行代码。

数十个Claude智能体通过开源的Prove2Me协作平台分工推进,整体消耗约60亿输出token。证明经Lean校验、仅依赖其三条标准公理,并由帝国理工的Kevin Buzzard审阅。

业务背景与问题

费马大定理是人类数学史上最著名的难题之一,人类首个完整证明1995年才由Wiles完成,而“把整条证明形式化成机器可逐行校验”此前被认为要耗时数年。

传统AI在长链条、易出错的复杂推理任务上往往难以保持一致性,形式化验证则要求每一步都严格可校验,这对AI的自主长程推理能力提出了极高要求。

AI如何落地

Anthropic采用“Claude+多智能体框架+Prove2Me协作平台”的方式:数十个Claude智能体分工推进,通过协作平台维护任务图谱,把复杂长链任务拆成有依赖关系的子任务,以缓解模型记忆衰减。

过程中Claude证明约3万个中间定理(最终证明使用约2.95万个),证明体量超过主流数学库Mathlib的5倍。

实施步骤

Anthropic将Prove2Me协作平台开源,供外部研究者和开发者使用。

官方还透露,用三个个人级Claude Max订阅协作,团队3天就形式化完成了Vinogradov三素数定理,说明这种协作式形式化在消费级预算下也能推进。

Anthropic同时扩大了对外部数学家(纯数学与形式化方向)的免费/折扣订阅与科研资助。

结果证据与边界

证明经Lean校验、仅依赖其三条标准公理,并由帝国理工的Kevin Buzzard审阅,这是其可信度的核心证据。

结果与规模均由Anthropic自身披露,外部独立复现与更广泛落地仍在早期。

可复制动作

技术团队与科研组织可引入“证明助手/形式化工具+多智能体分工”的做法,把复杂长链任务拆成有依赖关系的子任务,用协作平台维护任务图谱。

把“机器可验证的证据”作为高正确性要求的AI产出的标配,而非只信模型自述;先在小而边界清晰的任务上验证多智能体协作的稳定性,再放大规模。

证据与边界

  • Claude在11天内基本自主用Lean语言写成约1300万行代码,证明约3万个中间定理(最终证明使用约2.95万个)。
  • 数十个Claude智能体通过开源的Prove2Me协作平台分工推进,整体消耗约60亿输出token。
  • 证明经Lean校验、仅依赖其三条标准公理,并由帝国理工的Kevin Buzzard审阅。
  • 官方称证明体量超过主流数学库Mathlib的5倍。
  • 结果与规模均由Anthropic自身披露,外部独立复现与更广泛落地仍在早期。

企业今天可以做什么

可复制动作面向技术团队与科研组织:一是引入“证明助手/形式化工具+多智能体分工”的做法,把复杂长链任务拆成有依赖关系的子任务,用协作平台(如Prove2Me)维护任务图谱以缓解模型记忆衰减;二是把“机器可验证的证据”作为高正确性要求的AI产出的标配,而非只信模型自述;三是先在小而边界清晰的任务上验证这种多智能体协作的稳定性,再放大到更大规模;四是关注实验室开放的外部研究员资助与订阅渠道,低成本试探能力边界。

资料来源

公众号原题:Formalizing Fermat's Last Theorem · 查看公众号原文

你的企业,AI最该先改哪一段?

带着一个真实业务问题,先做一次增长诊断。

获取增长诊断