MeSH 용어의 전문가 대 자동 분류기 비교: Cohen 벤치마크에서의 bag-of-words와 BiomedBERT
Evaluation design conditions the expert-vs-auto MeSH gap: a controlled comparison of bag-of-words and BiomedBERT on the Cohen benchmark
이 연구에서는 MeSH 용어를 전문가와 자동 도구가 각각 할당한 경우의 분류 성능을 비교하였다. Cohen et al. (2006) 약물 분류 벤치마크를 사용하여 bag-of-words 로지스틱 회귀 분류기와 BiomedBERT를 평가하였고, Statins에 대한 결과는 5-fold 전체 데이터셋 설계에서 +0.096 WSS@95%로 나타났다. 데이터셋 크기를 줄이면 이 값은 +0.033으로 감소하였고, 10-fold 교차 검증에서는 +0.021로 나타났다. BiomedBERT는 +0.020의 결과를 보였으며, 전문가 MeSH 용어가 추가될 경우 15.1%의 Statins 입력이 BiomedBERT의 512-token 제한을 초과하여 절단이 발생할 수 있음을 시사한다.
Statins에 대한 평가에서 bag-of-words와 BiomedBERT의 성능 차이는 평가 설계에 따라 달라질 수 있다.
원문 출처
arXiv cs.CL (계산언어학·NLP)