GPU 아키텍처에 따른 3D 생성 확산 모델의 성능 분석 및 최적화
Performance Analysis and Optimization of 3D Generative Diffusion Models across GPU Architectures
확산 모델은 고충실도 3D MRI 합성에 필수적이나, 수백 개의 U-Net 평가로 인한 GPU 자원 요구가 크다. 본 논문은 NVIDIA 아키텍처 3세대에서 의료 확산 모델 Med-DDPM의 성능 분석을 수행하고, 커널 수준의 런타임 분해, 메모리 시스템 활용도, 텐서 코어 활용도를 평가하였다. cuDNN 컨볼루션과 암묵적 GEMM 커널이 훈련의 대부분을 차지하며, 메모리 접근 패턴과 텐서 레이아웃 변환에서 비효율성이 발생함을 보여준다. TF32 텐서 코어 활성화 및 3D 채널-마지막 레이아웃 최적화를 통해 SM 사이클을 최대 100배 줄이고, 동적 명령어 수를 100배 감소시키며, A100에서 텐서 코어 활용도를 1.45에서 9.98배로 증가시켰다.
이 연구는 GPU 자원 최적화를 통해 의료 이미지 합성의 효율성을 크게 향상시킬 수 있는 방법을 제시한다.
원문 출처
arXiv cs.LG (머신러닝)