SPSD를 통한 클라우드 LLM 추론에서의 사용자 프롬프트 압축
Closing the Social-Semantic Gap: SPSD for Edge-Based Prompt Compression in Cloud LLM Inference
SPSD(Sentiment Preserving Semantic Distillation)는 4비트 양자화된 소형 언어 모델을 사용하여 사용자 프롬프트를 압축하고 클라우드에 배포된 LLM으로 전송하는 엣지 기반 파이프라인이다. 248개의 프롬프트를 평가한 결과, 평균 99.9개의 입력 토큰이 절약되었으며, 모든 146개의 압축 호출에서 긍정적인 절약이 나타났다. 응답 품질은 15점 척도에서 사전 지정된 1점 마진 내에서 원본 경로와 비슷한 수준으로 평가되었고, 안전-critical 도메인은 규칙 기반 게이트를 통해 보수적으로 처리된다. 각 호출당 순 에너지 절약량은 70-270 uWh로 추정된다.
SPSD는 클라우드 LLM의 입력 토큰 비용을 줄이면서 응답 품질을 유지할 수 있는 방법을 제시한다.
원문 출처
arXiv cs.LG (머신러닝)