Muon 옵티마이저를 활용한 지속적 학습과 모델 병합의 과제 간섭 해결
When Muon Meets Task Interference: A Spectral Perspective on Continual Learning and Model Merging
지속적 학습(CL)과 모델 병합(MM)은 각각 치명적인 망각과 가중치 분리 오류에 의해 도전받는다. 본 연구에서는 두 가지 문제가 사실상 동일한 현상인 '과제 간섭'으로 정의되며, 이는 파라미터 업데이트가 한 과제에 유용할 때 다른 과제의 모델 출력을 변화시킨다고 설명한다. Muon 옵티마이저는 이러한 과제 간섭을 조절하는 메커니즘으로, AdamW 옵티마이저를 Muon으로 교체할 경우 8개 과제 모델 병합 벤치마크에서 최대 5.02 포인트의 정확도 향상을 보여준다. 또한 Muon은 10개 클래스 증가 프로토콜, 3개 과제 증가 프로토콜, 11개 과제 MTIL 벤치마크에서도 긍정적인 성과를 낸다.
Muon 옵티마이저는 지속적 학습과 모델 병합에서 과제 간섭을 조절하여 성능을 향상시킬 수 있다.
원문 출처
arXiv cs.LG (머신러닝)