딥러닝에서의 스케일링 법칙의 중요성
Scaling Laws, Carefully
스케일링 법칙은 딥러닝에서 중요한 경험적 발견으로, 모델 크기 $N$, 데이터셋 크기 $D$, 그리고 컴퓨트 $C$를 증가시킬 때 훈련 손실 $L$이 예측 가능하게 감소한다는 관찰을 포함한다. 이 관계는 파워-로우 곡선을 따르며, 로그-로그 플롯에서 직선으로 나타난다. 스케일링 법칙은 컴퓨트, 손실, 모델 크기 및 데이터 간의 관계를 설명하는 프레임워크로, $N$과 $D$ 간의 최적 컴퓨트 할당에 관한 것이다.
원문 출처
Lil'Log (Lilian Weng)