KVBoost: 효율적인 대형 언어 모델 추론을 위한 청크 수준 키-값 캐시 재사용 시스템
KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference
KVBoost는 HuggingFace 호환 디코더 모델을 위한 청크 수준의 키-값 캐시 재사용 시스템으로, 콘텐츠 위치에 관계없이 재사용을 가능하게 한다. 이 시스템은 위치 식별(prefix hash)과 콘텐츠 식별(content hash)을 분리하는 이중 해시 키잉 방식을 도입하여 정확한 및 근사 캐시 일치를 지원한다. KVBoost는 선택적 재계산(SelectiveRecompute) 및 캐시 블렌드 재계산(CacheBlendRecompute)과 같은 두 가지 수리 전략을 사용하여 독립적으로 캐시된 청크에서 발생하는 주의 경계 오류를 해결한다. Qwen/Qwen2.5-3B 모델을 대상으로 한 평가에서 KVBoost는 첫 번째 토큰까지의 시간을 4.49배 단축시키고, 정확도는 유지한 채로 기존의 프리픽스 캐싱보다 16% 향상된 성능을 보였다.
KVBoost는 142.4 ms의 시간으로 첫 번째 토큰을 생성하여 기존의 639.1 ms보다 4.49배 빠른 성능을 제공한다.
원문 출처
arXiv cs.AI (인공지능)