最新的擴展定律爭論提醒我們,AI 基礎設施策略依賴於研究假設。如果一個實驗室認為在固定計算預算下更大的模型是最佳選擇,它將以不同方式購買、分配和安排 GPU,與認為更好的數據平衡是關鍵的實驗室不同。
爭議焦點在於 OpenAI 原始擴展定律方向與 DeepMind 後來的 Chinchilla 結果之間的差異。早期的方案幫助證明在相對有限的數據量上訓練非常大的模型是合理的。Chinchilla 則主張許多大型模型訓練不足,模型大小與數據應該更均衡地一起擴展。
浪費的計算量難以公開驗證,但更大的教訓很明顯。在前沿 AI 領域,一個小的研究方法假設就能重新導向數百萬美元的計算資源,影響產品時間表,塑造模型架構,並影響每個下游 AI 工具的經濟效益。


