Cloudflare의 Workers AI에서 Kimi K 시리즈와 GLM 모델 최적화
Smaller, faster, safer: running Kimi and GLM at scale
Cloudflare의 Workers AI는 Kimi K 시리즈와 GLM 모델을 GPU에서 효율적으로 실행하기 위한 세 가지 기술을 적용했다. KV 캐시를 8비트에서 4비트로 양자화하여 메모리 사용량을 줄이고, GLM 5.2의 모델 가중치를 8비트에서 4비트로 압축하여 메모리 요구량을 40% 감소시켰다. 이러한 최적화는 고객 수를 늘리면서도 비용을 낮추고 모델 정확도에는 변화가 없음을 확인했다.
Kimi K2.6는 KV 캐시 양자화를 통해 메모리에서 처리할 수 있는 토큰 수를 약 686,000에서 1.37백만으로 증가시켰다.
원문 출처
Cloudflare Blog — AI