자체 LLM API에서 추론 추적 탈취하기
Stealing Reasoning Traces from Proprietary LLM APIs
Anthropic, OpenAI, Google의 모델은 암호화된 추론 블록을 클라이언트에 반환하며, 이를 통해 더 약한 모델에서 강한 모델의 숨겨진 추론을 복구할 수 있다. 연구진은 동일한 암호화 키를 사용하는 모델들에서 이 블록을 다시 입력하여 약한 모델을 해킹하고 원래의 추론을 복원하는 방법을 발견했다. 그러나 이 공격 방식은 모델 제공자들이 보고를 받은 후 수정되었다.
모델 제공자들이 암호화된 추론 블록을 사용하는 방식을 변경함으로써, 이전의 공격 방식이 더 이상 통하지 않게 되었다.
원문 출처
Simon Willison's Weblog