최신 스케일링 법칙 논쟁은 AI 인프라 전략이 연구 가정에 의존한다는 점을 상기시켜줍니다. 연구소가 고정된 컴퓨팅 예산에서 더 큰 모델이 최선의 사용이라고 믿는다면, GPU 구매, 할당 및 스케줄링 방식을 데이터 균형이 핵심이라고 믿는 연구소와 다르게 할 것입니다.
논쟁의 중심은 OpenAI의 원래 스케일링 법칙 방향과 DeepMind의 이후 Chinchilla 결과 간의 차이입니다. 초기 공식은 비교적 적은 양의 데이터로 매우 큰 모델을 훈련시키는 것을 정당화하는 데 도움을 주었습니다. Chinchilla는 이후 많은 대형 모델이 과소훈련되었으며 모델 크기와 데이터가 더 균등하게 함께 확장되어야 한다고 주장했습니다.
낭비된 컴퓨팅 양을 공개적으로 정확히 검증하기는 어렵지만, 더 큰 교훈은 명확합니다. 최첨단 AI에서는 작은 방법론적 가정 하나가 수백만 달러의 컴퓨팅 방향을 바꾸고, 제품 일정에 영향을 미치며, 모델 아키텍처를 형성하고, 모든 후속 AI 도구의 경제성에 영향을 미칩니다.


