Amazon SageMaker Inference의 접두사 인식 라우팅 도입
Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference
Amazon SageMaker Inference는 요청의 시작 부분을 분석하여 동일한 접두사를 가진 요청을 같은 인스턴스로 라우팅하는 접두사 인식 라우팅 기능을 도입했다. 이 기능은 Llama 3.1 70B 모델을 사용한 벤치마크에서 P50 첫 토큰 시간(TTFT)을 최대 77% 단축하고, 처리량을 최대 16% 증가시켰으며, KV 캐시 적중률을 약 25%에서 80% 이상으로 향상시켰다. 또한, 요청이 인스턴스에 균등하게 분산되지 않도록 하여 캐시의 효율성을 높인다.
접두사 인식 라우팅은 동일한 요청 패턴에 대해 KV 캐시를 재사용하여 처리 성능을 크게 향상시킬 수 있다.
원문 출처
AWS Machine Learning Blog