Claude 几乎自主完成的首个端到端 Lean 形式验证费马大定理,不仅是研究领域的重大新闻,更是我们验证 AI 生成结果方式的转折点。它不再依赖社会认同和数月的人工审稿,而是通过可编译的成果物来验证。据报道,该过程涉及数百万行 Lean 代码,多个智能体证明并复用了数万个引理。关键的转变在于架构层面:AI 不再仅输出叙述或草图,而是生成机器可检验的数学证明,其他人可以重新编译、对比和扩展。这使得 AI 辅助发现更接近软件工程,正确性可由构建系统强制执行,而非辩论决定。
如此规模的自动形式化需要协调原语以保持多个智能体的同步且不丢失全局状态。一个定理的有向无环图(DAG)优先确定下一个证明目标;将陈述与证明分离提升了增量构建效率;自然语言描述增强了复用能力。这些模式共同解决了大型数学项目中的两个长期难题:碎片化和重编译拖延。结果暗示了一个可复制的流程:选择规范陈述,编码依赖关系,利用专门智能体群体协作,并通过编译部分证明持续验证。若细看,这就像数学领域的 CI/CD,定理 DAG 替代依赖图,证明检查器充当封闭测试套件。
对从业者而言,影响立竿见影。形式验证不再是遥远的理想,而是密码学、机制设计、风险管理和科学计算等高风险领域的实用控制手段。企业可以在研究流程中引入“验证门”,要求核心结果具备机器可检验的证明或可验证的简化。模型开发者可以与代码同步开发证明,使假设早期自检,减少无效投入。投资者和研发领导获得更明确的尽职调查信号:以编译成功率、定理覆盖率和库复用度衡量,而非仅凭白皮书。瓶颈转向库的广度、协调可靠性及人力在前沿定义引导上的投入。


