신뢰할 수 있는 LoRA 어댑터로 제한된 모델 학습 접근법
What if a model could only learn what trusted LoRA adapters can express? [R]
한 연구자가 모델이 악의적인 업데이트를 학습하지 못하도록 하는 방법을 탐구하였다. 이 방법은 모델의 파인튜닝을 신뢰할 수 있는 LoRA 어댑터에서 학습한 서브스페이스로 제한하여, 유용한 적응은 가능하지만 악의적인 방향은 기하학적으로 도달할 수 없도록 한다. 연구에서는 196개의 공개 LoRA 어댑터를 테스트하였고, 공격 성공률이 급격히 감소하면서 유용한 적응이 유지되는 결과를 보였다. 관련 논문과 코드는 공개되어 있다.
이 접근법은 모델이 신뢰할 수 있는 데이터만 학습하도록 하여 악성 데이터의 영향을 줄일 수 있다.
원문 출처
r/MachineLearning