불확실성 샘플링에서 오류 노출 및 위치 테스트
Hard Cases, Bad Labels: Testing Error Exposure and Error Location in Uncertainty Sampling Under Bounded Label Noise
이 연구는 불확실성 샘플링이 더 많은 손상된 레이블을 획득하는지 또는 어려운 영역에서의 오류가 특히 해로운지를 테스트한다. 세 가지 공개 이진 표 데이터셋에서 마진 기반 불확실성 샘플링과 무작위 샘플링을 비교하였으며, 100개의 쌍 시드, 0에서 0.30까지의 아홉 가지 예상 노이즈 비율, 20에서 120까지의 주석 예산을 사용하였다. 깨끗한 레이블 하에서 불확실성 샘플링은 모든 데이터셋에서 학습 곡선 아래의 정규화된 균형 정확도를 1.09에서 1.77 포인트 향상시켰다. 그러나 난이도 의존 노이즈는 여섯 개의 비율에서 이 이점을 감소시켰다. 불확실성 샘플링은 레이블 효율적이었지만, 그 강건성은 데이터셋, 예산, 노이즈 구조 및 평가 메트릭에 따라 달라졌다.
불확실성 샘플링은 깨끗한 레이블 하에서 모든 데이터셋에서 정규화된 균형 정확도를 1.09에서 1.77 포인트 향상시켰다.
원문 출처
arXiv cs.LG (머신러닝)