Amazon SageMaker HyperPod의 모델 캐싱으로 추론 대기 시간 단축
Reduce inference cold starts on Amazon SageMaker HyperPod with model caching
Amazon SageMaker HyperPod에서 대형 언어 모델을 배포할 때, 요청한 포드가 준비되기까지의 시간은 주로 두 가지 다운로드 과정에 의해 지연된다. 모델 캐싱 기능이 도입되어 모델 가중치와 컨테이너 이미지를 미리 클러스터 노드에 로드함으로써, 포드 시작 시 로컬 NVMe 저장소에서 약 7 GB/s 속도로 데이터를 읽을 수 있게 되어, 포드가 트래픽을 서비스하는 데 걸리는 시간이 몇 분으로 단축된다.
모델 캐싱을 활성화하면 포드가 수 초 내에 트래픽을 서비스할 수 있어, 대형 모델의 경우 30분 이상 소요되던 대기 시간을 크게 줄일 수 있다.
원문 출처
AWS Machine Learning Blog