Qwen3.6 NVFP4 모델의 성능 향상
2.5x faster Qwen3.6 NVFP4 Unsloth quants
Qwen3.6 27B 모델의 NVFP4 양자화가 2.5배 빨라졌으며, 35B-A3B 모델은 NVIDIA의 NVFP4 양자화에 비해 1.56배에서 1.79배 더 빠른 성능을 보인다. 이 과정에서 정확도 저하 없이 W4A4를 사용하여 실제 4비트 텐서 코어로 행렬 곱셈을 수행했다. FP8 KV 캐시 보정 기능이 추가되어 2배 더 긴 컨텍스트를 자동으로 허용한다. NVFP4-Fast와 NVFP4 두 가지 35B 버전이 제공되며, NVFP4-Fast는 W4A4를 완전히 활용하고 NVFP4는 혼합 방식을 사용하여 약간 더 높은 정확도를 유지한다.
원문 출처
r/LocalLLaMA