Amazon SageMaker AI에서 Unsloth를 이용한 양자화 모델 배포
Deploying quantized models on Amazon SageMaker AI with Unsloth
대형 기초 모델을 원래의 16비트 부동소수점 정밀도로 저장하면 비용이 많이 든다. 양자화는 모델의 가중치 정밀도를 줄여 메모리 사용량을 크게 줄인다. 동적 양자화는 메모리 사용량을 줄이면서 정확도를 유지할 수 있는 방법이다. Unsloth는 기초 모델을 미세 조정하고 양자화하는 도구로, 동적 양자화는 각 레이어의 정밀도 손실에 대한 민감도를 분석하여 중요한 레이어는 높은 정밀도로 유지하고 덜 중요한 레이어는 공격적으로 양자화한다. AWS에서 배포할 때 양자화는 인스턴스 결정, 시작 및 저장 프로필, 배포 유연성에 영향을 미친다.
Unsloth를 사용하면 8억 개의 매개변수를 가진 모델의 메모리 사용량을 약 16GB에서 약 5GB로 줄일 수 있다.
원문 출처
AWS Machine Learning Blog