Amazon SageMaker HyperPod에서 Curvine을 활용한 대형 LLM을 위한 계층형 KV 캐시 구축
Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine
대형 언어 모델(LLM) 추론 시 KV 캐시의 크기와 성능 간의 트레이드오프가 존재한다. Amazon SageMaker HyperPod에서 Managed Tiered KV Cache와 Curvine을 활용하여 GPU와 CPU 메모리를 넘어 공유 NVMe 풀로 캐시 계층을 확장하는 아키텍처를 구축하였다. 이 설정을 통해 여러 복제본 간에 KV 캐시를 재사용할 수 있으며, 테스트 배포에서 최대 100%의 교차 Pod 캐시 적중률과 2.7배의 TTFT 개선을 달성하였다. 이 아키텍처는 P5 인스턴스 대신 G6e 인스턴스에서 실행할 수 있어 비용 절감 효과를 가져온다.
이 아키텍처는 P5 인스턴스 대신 G6e 인스턴스에서 대형 LLM을 실행할 수 있게 하여 인프라 비용을 절감할 수 있다.
원문 출처
AWS Machine Learning Blog