大多數 AI 閱讀工具會摘要論文;Faraday 則嘗試重新執行它們。Inherent 的新代理專注於複製:識別關鍵實驗步驟、設計可執行程序,並報告結果是否成立。該公司表示,Faraday 運行於相對較小的 Qwen 27B 級模型並搭配外部工具,在內部複製任務中表現優於規模更大的 OpenAI 和 Anthropic 系統。即使這些數據仍屬初步,目標的轉變值得關注。複製使科學嚴謹性具體化,直接關聯實驗室產能與可信度,比引用提取或文獻回顧品質更能反映實際效用。
所謂優勢似乎來自代理設計,而非單純模型大小:透過強化學習培養「研究品味」、謹慎規劃實驗,以及務實依賴現有程式碼助手來實作。這種架構反映人類團隊的實際運作方式——主持教授設定假說,博士後制定計劃,工具負責產出程式碼與圖表。若目標是可重現性,協調能力與推理同等重要。開放問題在於外部效度:這些成果是否能在公開、盲測、多領域的測試平台中持續展現,並以成功率@k、資料存取平等及複製時間等透明指標衡量?
若複製代理成熟,其影響將立即顯現於生技、材料與機器學習研究組織。它們能在分配實驗台前預先篩選高投入論文、壓力測試實驗室標準作業程序,並記錄負面結果——這些往往珍貴卻少被報導。對企業而言,這將 AI 從閱讀助手轉變為涵蓋研發、合規與智慧財產盡職調查的驗證層。但治理至關重要:必須制定資料來源、程式碼執行、授權資料集與主張升級的防護措施。缺乏透明協議與審計軌跡,規模化複製恐加速錯誤方法擴散,而非提升科學可靠性。

