이해 가능한 DistilBERT-BiLSTM-어텐션 프레임워크를 통한 이진 및 다중 클래스 혐오 발언 탐지
An Explainable DistilBERT-BiLSTM-Attention Framework for Binary and Multi-Class Hate Speech Detection
소셜 미디어에서의 혐오 발언 탐지는 사회적 조화와 공공 안전을 위해 필수적이다. 본 연구는 DistilBERT 임베딩과 Bi-LSTM 모델, 어텐션 메커니즘을 통합한 다층적이고 설명 가능한 혐오 발언 탐지 프레임워크를 제안한다. 이 프레임워크는 LIME을 사용하여 모델 예측을 설명하고, 이진 분류에서 Davidson 데이터셋에서 96.78%, SMHS 데이터셋에서 99.53%의 F1 점수를 달성하며, 다중 클래스 설정에서는 각각 97.00%와 94.99%를 기록하여 기존 방법보다 우수한 성능을 보인다.
제안된 모델은 이진 분류에서 Davidson 데이터셋에서 96.78%의 F1 점수를 달성하여 혐오 발언 탐지의 신뢰성을 높인다.
원문 출처
arXiv cs.CL (계산언어학·NLP)