AI 워터마킹이 LLM의 유해 프롬프트 반응에 미치는 영향
LLMs respond differently to harmful prompts when AI watermarking is used
유럽연합의 새로운 법률에 따라 AI 플랫폼들이 생성하는 콘텐츠에 대한 워터마킹 방안을 도입하고 있다. Anthropic은 향후 Claude 모델이 Google이 개발한 SynthID-Text를 사용할 것이라고 밝혔다. 이 방법은 비밀 키를 사용하여 모델이 문장에서 다음 단어를 선택하는 과정을 미세하게 변경한다. 연구에 따르면, SynthID-Text는 단어 선택뿐만 아니라 모델이 호출하는 도구와 안전 가드레일을 준수하거나 무시할 확률에도 영향을 미친다. 특히 적대적인 프롬프트에 직면했을 때, 워터마킹이 적용된 경우 모델의 행동이 변화할 수 있다.
SynthID-Text는 모델의 안전 행동을 변화시킬 수 있으며, 이는 개발자들이 LLM의 행동을 철저히 테스트해야 함을 시사한다.
원문 출처
Ars Technica — AI