네이버 플레이스 AI MLOps의 vLLM 기반 모델 서빙 성능 최적화
우리 팀만의 vLLM 플러그인 만들기 1편 - 검색 AI 모델 서빙 성능 극대화하기
네이버 플레이스 AI MLOps는 지난 1년간 검색과 추천에 사용하는 스코어링 모델의 서빙 구조를 vLLM 기반으로 전환했다. 0.6B 재순위화 모델을 Hugging Face의 Transformer.encode로 서빙했을 때 처리량은 63.85 QPS였으나, vLLM의 score 태스크로 옮기자 397.21 QPS로 약 6.2배 증가했다. 속성 기반 감성 모델의 p50 지연 시간은 101.22ms에서 16.43ms로 83.8% 감소했고, CLIP 기반 이미지 랭킹 모델의 처리량은 3.76 img/s에서 62.2 img/s로 16.5배 증가했다.
vLLM을 통해 모델 서빙 성능을 극대화하여 처리량을 6.2배 증가시킬 수 있었다.
원문 출처
네이버 D2