llama.cpp의 P100 GPU 성능 개선을 위한 패치 배포
**Your $80 Tesla P100 has been doing silently noisy math in llama.cpp for years. Three lines fix it, for free.**
turboquant v0.3.0이 배포되었으며, CUDA 코드의 패치로 P100 GPU가 fp16 연산을 수행할 수 있게 되었다. 이 패치는 3줄로 구성되어 있으며, 성능 측정 결과 P100에서의 디코드 속도가 약 1.4% 빨라졌다. P100은 현재 약 80달러에 판매되고 있으며, 16GB HBM2 메모리를 갖추고 있다.
P100 GPU의 성능 개선으로 인해 저렴한 가격에 높은 성능을 활용할 수 있는 기회가 생겼다.
원문 출처
r/LocalLLaMA