NVIDIA Dynamo의 섀도 엔진 복구로 LLM 추론 용량 신속 복구
Restore LLM Inference Capacity in Seconds with Shadow Engine Recovery in NVIDIA Dynamo
LLM 엔진 프로세스가 실패할 경우, 표준 복구 경로는 콜드 리스타트가 필요하며, 이 과정에서 저장소에서 HBM으로 가중치를 로드하고, 커널을 컴파일하며, NVIDIA CUDA 그래프를 캡처해야 한다. 대형 모델의 경우 초기화에 몇 분이 소요되며, 이 동안 생존하는 작업자들은 이동된 트래픽을 처리해야 한다. NVIDIA Dynamo에서 미리보기 기능으로 제공되는 섀도 엔진 복구를 사용하면 이 과정을 신속하게 처리할 수 있다.
NVIDIA Dynamo의 섀도 엔진 복구 기능은 LLM 엔진의 신속한 복구를 가능하게 하여 시스템 가용성을 높인다.
원문 출처
NVIDIA Technical Blog