Amazon EKS에서 NVRx를 이용한 내결함성 분산 훈련
Fault tolerant distributed training on Amazon EKS using NVRx
대규모 분산 훈련 작업은 여러 노드에서 수 시간 또는 수일 동안 실행되며, 이 과정에서 네트워크 분할, 메모리 오류, 소프트웨어 예외 등이 발생할 수 있다. NVIDIA Resiliency Extension (NVRx)을 PyTorch Fully Sharded Data Parallel (FSDP) 훈련에 통합하여 비동기 체크포인팅, 프로세스 내 재시작, 작업 내 재시작 기능을 제공한다. Amazon EKS는 관리형 Kubernetes 서비스로, p5.48xlarge 인스턴스에서 NVIDIA H100 GPU를 사용하여 훈련 작업을 수행한다.
NVRx는 PyTorch에 내결함성 기능을 추가하여 훈련 중 발생할 수 있는 오류를 효과적으로 처리할 수 있다.
원문 출처
AWS Machine Learning Blog