선택된 응답과 거부된 응답 간의 어휘적 차이 분석
A lexical view of contrast pairs in preference datasets
LLM 훈련 파이프라인의 마지막 단계에서 선호 데이터는 필수적이다. RLHF 과정에서 보상 모델을 훈련하기 위해 선택된 모델 출력과 거부된 모델 출력을 쌍으로 보여준다. 이 블로그 포스트에서는 질적 측면 대신 문장 임베딩을 사용하여 선택된 응답과 거부된 응답 간의 어휘적 차이를 분석하는 접근 방식을 제안한다. 데이터셋으로는 OpenAI의 Summarize from Human Feedback, Stanford Human Preferences Dataset, Argilla의 Ultrafeedback, Tatsumoto Lab의 Alpaca Farm, Berkeley Nest Lab의 Nectar Dataset이 사용되었다. 문장 임베딩은 384차원으로 생성되었으며, 코사인 거리를 통해 선택된 벡터와 거부된 벡터 간의 거리를 측정하였다.
문장 임베딩을 통한 어휘적 거리 측정은 선호 데이터 생성 시 품질 기반 메트릭 대신 사용할 수 있는 새로운 방법을 제시한다.
원문 출처
Lj V. Miranda