LLM의 문학적 품질 평가에 대한 연구
What is Good? Extracting and Testing Implicit Theories of Literary Quality from LLM Reasoning Traces
이 연구는 LLM이 문학적 품질을 어떻게 평가하는지를 두 가지 연구를 통해 조사한다. 첫 번째 연구에서는 30개의 실제 텍스트를 기준으로 하여 LLM의 품질 이론을 추출하고, 5회의 DeepSeek 복제에서 평균 79.3%의 계층 분류 정확도를 달성하였다. LLM은 의도성을 정확성보다 더 중요하게 여기며, 작문 기술, 깊이, 독특한 목소리를 우선시한다. 두 번째 연구에서는 5개의 고전 산문을 체계적으로 변형하여 품질 변화를 평가하였고, 어휘 단순화가 가장 작은 품질 손실(0.41 +/- 0.46 포인트)을 초래했으며, 구조 단순화(2.78)와 목소리 손실(2.34)이 더 큰 영향을 미쳤다. 이 연구들은 LLM의 문학적 품질 판단이 전체적이며, 구조적 특성에 더 민감하다는 것을 시사한다.
LLM의 품질 평가가 구조적 특성에 더 민감하다는 점은 자동화된 작문 피드백 시스템 개발에 중요한 시사점을 제공한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)