ParallelKernelBench: LLM이 다중 GPU CUDA 커널 작성 성능 테스트
ParallelKernelBench: Frontier LLMs can't write fast multi-GPU kernels (yet)
ParallelKernelBench는 LLM이 87개의 실제 워크로드에 대해 빠른 다중 GPU CUDA 커널을 작성할 수 있는지를 테스트한다. 가장 성능이 좋은 모델은 3분의 1 이하의 문제를 해결했지만, 일부 생성된 커널은 공개 구현보다 더 나은 성능을 보였다.
LLM의 다중 GPU 커널 작성 능력에 대한 실질적인 성능 평가가 이루어져, 향후 개발에 참고할 수 있는 기준이 될 수 있다.
원문 출처
Together AI Blog