IDEA Prune: 생성 언어 모델 사전 훈련에서의 통합 확대 및 가지치기 파이프라인
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
대형 언어 모델의 최근 발전은 제한된 추론 예산 내에서 효율적이고 배포 가능한 모델에 대한 필요성을 증가시켰다. 구조적 가지치기 파이프라인은 처음부터 목표 크기 모델을 훈련하는 것에 비해 토큰 효율성에서 가능성을 보여주었다. 본 논문에서는 이전 연구에서 종종 무시되었던 확대 모델 사전 훈련을 가지치기에 통합하는 것을 주장하며, 확대 및 가지치기 파이프라인을 통합 시스템으로 연구하여 두 가지 주요 질문을 다룬다: 모델이 배포되지 않더라도 확대 모델을 사전 훈련하는 것이 가치가 있는지, 그리고 최적화 방법은 무엇인지에 대해 논의한다.
구조적 가지치기 파이프라인은 대형 언어 모델의 토큰 효율성을 개선할 수 있다.
원문 출처
Apple Machine Learning Research