저자극 언어 생성을 위한 활성화 조정 연구
Want Better Synthetic Data? Steer It: Activation Steering for Low-Resource Language Generation
대형 언어 모델(LLM)은 저자원 언어의 합성 데이터 생성을 위한 효과적인 도구로, 생성된 데이터는 하위 작업 성능을 향상시킬 수 있다. 현재의 최상위 접근 방식은 목표 언어 예제를 포함한 몇 가지 샘플 프롬프트에 의존하며, 이는 추론 비용을 증가시키고 어휘 고정화로 인해 다양성을 감소시킬 수 있다. 본 연구에서는 저자원 합성 데이터 생성을 위한 대안으로 활성화 조정을 조사하고, 언어 정체성을 목표로 하는 언어 조정과 인간 작성 및 역번역된 텍스트 표현을 대조하여 잘 형성된 정도를 포착하는 품질 조정의 두 가지 전략을 연구하였다. 이 방법들은 4개의 오픈 소스 LLM, 여러 층, 11개의 유형적으로 다양한 언어에서 감정 및 주제 분류 데이터를 생성하고 소형 분류기를 미세 조정하는 데 평가되었다. 조정은 제로샷 및 몇 샷 프롬프트 설정 모두에 적용되었으며, 비조정 모델과 비교되었다. 결과적으로 초기 층에서의 조정이 생성된 데이터의 다양성을 일관되게 향상시키고, 저자원 언어에 대해 하위 모델 성능을 강화하는 경향이 있음을 보여주었다.
원문 출처
arXiv cs.CL (계산언어학·NLP)