대규모 언어 모델의 제2차 사회적 추론 평가
Beyond Right and Wrong: Evaluating Second-order Social Reasoning in Large Language Models
이 연구는 대규모 언어 모델(LLM)의 제2차 사회적 규범인 메타규범을 평가하기 위한 새로운 프레임워크를 소개한다. 메타규범은 사회 규칙이 위반될 때 사람들의 반응을 지배하는 기대를 포함한다. 연구팀은 450개의 규범 위반 시나리오로 구성된 NormReact라는 다각적 데이터셋을 공개하였으며, 감정과 행동 반응을 성별 및 사회적 친밀도에 따라 수작업으로 주석을 달았다. 현재 LLM은 인간이 예상하는 비활동보다 부정적인 제재를 과도하게 예측하며, 사회적 거리 증가에 따라 인간 판단과의 일치도가 저하되는 경향이 있다.
이 연구는 LLM이 규범 민감한 분야에서 왜곡된 사회 규제 그림을 생성할 위험이 있음을 시사한다.
원문 출처
arXiv cs.AI (인공지능)