전문가 모델의 방출이 적응 및 조정보다 우수한 경우
Model of Models: When Does Emitting a Specialist Beat Attending, Adapting, or Tuning?
이 연구에서는 네 가지 메커니즘(제로샷, 인컨텍스트 주의, 테스트 시간 그래디언트 적응, 하이퍼네트워크에서 전문가 가중치 방출)을 비교하여 모델을 어떻게 전문화할 수 있는지를 다룬다. 방출 방식은 임상 몇 샷 분류에서 TabPFN과 동등한 품질로 비용을 절감하며, 몇 샷 사인 회귀에서는 MAML보다 2~3배 낮은 비용을 기록했다. 그러나 고차원 시퀀스 모델링에서는 인컨텍스트 주의에 비해 성능이 떨어졌다.
원문 출처
arXiv cs.LG (머신러닝)