Claude 幾乎自主完成的首個端到端 Lean 驗證費馬大定理正式化,不僅是研究新聞,更是我們驗證 AI 生成結果方式的轉折點。它不再依賴社會認可或數月的人工審核,而是能成功編譯。據稱該過程涵蓋數百萬行 Lean 代碼,代理人證明並重用數萬個引理。關鍵變革在於架構:AI 不再僅輸出敘述或草稿,而是產生可機器檢查的數學證明,其他人能重新編譯、比較差異並擴展。這使 AI 輔助發現更接近軟體工程,正確性可由構建系統強制,而非辯論決定。
如此規模的自動正式化需要協調原語,讓多個代理保持一致且不丟失全局狀態。定理的有向無環圖(DAG)用於優先排序證明任務;聲明與證明分離提升增量構建效率;自然語言描述促進重用。這些模式共同解決大型數學項目中兩大瓶頸:碎片化與重編譯拖延。結果暗示一條可複製流程:選擇標準聲明、編碼依賴關係、由專門代理群體協作,並通過編譯部分證明持續驗證。若仔細觀察,這就像數學領域的 CI/CD,定理 DAG 取代依賴圖,證明檢查器則充當封閉測試套件。
對實務者而言,影響立竿見影。形式驗證不再是遙不可及的理想,而是密碼學、機制設計、風險管理和科學計算等高風險領域中實用的控制手段。企業可在研究流程中設置「驗證門檻」,要求核心結果具備機器可檢查的證明或可驗證的簡化。模型開發者能與代碼同步開發證明,使假設及早自我檢查,減少在死胡同浪費的時間。投資者與研發主管獲得更清晰的盡職調查指標:以編譯成功率、定理覆蓋率和庫重用度衡量,而非僅憑白皮書。瓶頸將轉向庫的廣度、協調可靠性及人力在前沿定義指導上的投入。


