NVIDIA T4에서 A100 대비 170배 느린 PyTorch 모델 실행
PyTorch model running 170x slower on T4 vs A100. What could cause a bottleneck this extreme? [D]
NVIDIA A100에서 포인트 추적 모델이 반 비디오당 약 0.5초 소요되는 반면, T4에서는 같은 호출이 약 85초 소요되어 170배 느려진다. 비디오는 256×256 해상도의 47프레임으로, 배치는 1이다. 현재 GPU는 99% 활용 중이며, 모델은 GPU에서 실행되고 있다. torch.backends.cudnn.benchmark를 활성화해도 효과가 없고, 두 개의 독립적인 T4 머신에서 동일한 느린 성능이 나타났다.
T4에서 A100보다 170배 느린 성능의 원인을 파악하는 것은 모델 최적화에 중요하다.
원문 출처
r/MachineLearning