最新のスケーリング則論争は、AIインフラ戦略が研究の仮定に依存していることを思い出させます。もし研究所が固定された計算予算でより大きなモデルが最善の利用法だと信じていれば、GPUの購入、割り当て、スケジューリングは、より良いデータバランスが鍵だと信じる研究所とは異なる方法で行われるでしょう。
論争の中心は、OpenAIの元のスケーリング則の方向性とDeepMindの後のChinchillaの結果の違いにあります。初期のレシピは、比較的控えめなデータ量で非常に大きなモデルをトレーニングすることを正当化するのに役立ちました。Chinchillaは後に、多くの大規模モデルが過小トレーニングされており、モデルサイズとデータはより均等にスケールすべきだと主張しました。
浪費された計算量の正確な量は公に検証するのは難しいですが、より大きな教訓は明確です。最先端のAIでは、小さな方法論的仮定が何百万ドルもの計算資源の方向を変え、製品のタイムラインを形作り、モデルアーキテクチャに影響を与え、すべての下流のAIツールの経済性に影響を及ぼします。


