인도 구술 전통에서의 내러티브 동질화: LLMs의 영향
Which India Survives Translation? Narrative Homogenisation Across Indian Oral Traditions in LLMs
대형 언어 모델(LLMs)은 주로 영어 인터넷 텍스트로 훈련되어 특정 문화 내러티브를 과도하게 대표하며, 비서구 스토리텔링 전통의 다양성을 단일 동질화된 원형으로 축소할 우려가 있다. 본 연구는 라자스탄의 파부지 서사, 고전 타밀 상감 시, 벵골 민속 이야기 등 세 가지 인도 지역 구술 및 문학 전통을 대상으로 LLM 두 개(Claude Sonnet, Gemini)에 54개의 생성 요청을 통해 분석하였다. 결과적으로, 출력은 자신의 전통 참조와 더 가까웠으나, 전통 간 유사성은 높았으며(0.52-0.66), 지역 언어로 프롬프트를 제공할 경우 진정성 유지가 감소하는 경향이 있었다.
지역 언어로 프롬프트를 제공할 경우 Rajasthani 및 Bengali 전통에서 진정성 유지가 최대 27% 감소했다는 점은 LLM의 문화적 표현에 대한 중요한 시사점을 제공한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)