Amazon SageMaker HyperPod Inference Gateway 소개
Introducing Amazon SageMaker HyperPod Inference Gateway
Amazon SageMaker HyperPod Inference Gateway는 Kubernetes-native, GPU-aware 라우팅 시스템으로, 기존 HyperPod 인프라에 단일 EKS 관리 애드온으로 배포된다. 이 시스템은 실시간 GPU 신호를 사용하여 각 추론 요청을 최적의 포드에 배치하여 지연 시간을 줄인다. 기본 Kubernetes 로드 밸런서의 문제를 해결하여, 요청이 바쁜 포드 뒤에 쌓이는 것을 방지하고 GPU 활용도를 균일하게 유지한다.
첫 번째 토큰 지연 시간을 82%까지 줄일 수 있다.
원문 출처
AWS Machine Learning Blog