llama.cpp PR, Intel Battlemage에서 118K 컨텍스트에서 최대 169% 빠른 양자화 KV 디코드 보고
llama.cpp PR reports up to 169% faster quantized-KV decode at 118K context on Intel Battlemage from one SYCL kernel switch
llama.cpp PR(#26689)은 SYCL FlashAttention 배치 결정을 변경하여 양자화된 KV 캐시(q4_0, q8_0)에서 디코드를 VEC 커널 대신 TILE로 전환함으로써 성능을 향상시켰다. 테스트 결과, Qwen3.6-35B의 경우 q4_0 KV에서 12.99 t/s에서 29.61 t/s로 (+127.9%), Gemma 4 12B의 경우 q4_0 KV에서 5.06 t/s에서 13.59 t/s로 (+168.7%) 증가했다. 이 PR은 아직 병합되지 않았으며, 독립적인 하드웨어 검증이 필요하다.
Qwen3.6-35B에서 q4_0 KV의 성능이 12.99 t/s에서 29.61 t/s로 증가하여, 양자화된 KV 디코드의 효율성을 높일 수 있다.
원문 출처
r/LocalLLaMA