Leak It: 블랙박스 언어 모델에서의 훈련 데이터 추출에 대한 확률적 접근
Leak It: A Probabilistic Approach to Training-Data Extraction from Black-Box Language Models
언어 모델에 대한 멤버십 추론(MIA)은 일반적으로 ROC-AUC로 요약되지만, 이러한 평가는 혼란스러울 수 있다. 본 연구에서는 블랙박스 샘플링 기반 훈련 데이터 누출을 확률적 관점에서 연구하며, WikiMIA에서 블라인드 bag-of-words 분류기가 AUC 0.97을 달성했으나 샘플링은 아무런 기여를 하지 못했다. Pythia-6.9B 모델에서는 500개의 Pile 문서 중 83개(16.6%)가 실제 식별자를 재현했으며, 이 누출은 문서별로 귀속되었다. 또한, 코드에서의 식별자 누출 위험이 산문보다 약 3배 강한 것으로 나타났다. 프라이버시 감사는 단일 AUC가 아닌 도메인별로 문서별 추출을 보고해야 한다.
Pythia-6.9B 모델에서 500개의 Pile 문서 중 16.6%가 실제 식별자를 재현하여, 각 누출이 특정 문서에 귀속된다는 점은 데이터 프라이버시 관리에 중요한 시사점을 제공한다.
원문 출처
arXiv cs.LG (머신러닝)