Qwen3.6-35B-A3B 모델의 깊이 인식 민감도 분석
Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking
Mixture-of-Experts (MoE) 아키텍처는 대형 언어 모델의 계산 효율성을 유지하면서 스파스 활성화를 통해 확장된다. 본 논문은 Qwen3.6-35B-A3B 모델(40 MoE 레이어, 레이어당 256 전문가, top-8 라우팅)에 대한 체계적인 레이어별 민감도 분석을 수행하였다. 초기 레이어(0-9)와 중간 레이어(10-29)는 전문가 마스킹에 매우 민감한 반면, 후반 레이어(30-39) 및 특히 매우 후반 레이어(35-39)는 저강도 전문가의 공격적인 마스킹을 견딜 수 있다. 30%의 전 레이어 마스킹은 300 프롬프트에서 150/300 Good+Similar 출력을 유지하는 반면, 후반 중심 정책은 249-255/300을 유지하며 640-1,145 전문가를 마스킹한다. 500 프롬프트 검증에서 35-39 레이어에서 50% 마스킹을 적용한 좁은 정책이 419/500 Good+Similar 출력을 유지하며 10,240 전문가 중 640만 마스킹한다는 결과를 보였다.
Qwen3.6-35B-A3B 모델의 깊이 인식 전문가 마스킹은 모델 압축 및 효율적인 성능 개선을 위한 실질적인 경로를 제공한다.
원문 출처
arXiv cs.AI (인공지능)