NAVER ENGINEERING DAY 2026에서 발표된 MLXP와 LLM Serving 최적화 기술
MLXP : Kubernetes LLM Serving 최적화 기술 도입기
NAVER ENGINEERING DAY 2026에서 LLM 추론 성능을 극대화하기 위한 기술(KV Cache 인지 라우팅, Prefix Cache, 분산 멀티노드 서빙 등)을 Kubernetes 환경에 도입하는 과정에서 발생한 문제를 진단하고 해결한 사례를 공유하였다. 발표는 Kubernetes에서 GPU 워크로드를 운영하는 플랫폼 엔지니어, LLM 서빙 인프라를 구축·운영하는 MLOps/Infra 엔지니어, Istio 서비스 메시 환경에서 AI 워크로드를 다루는 DevOps 엔지니어를 대상으로 진행되었다.
원문 출처
네이버 D2