Alibaba, Qwen3.8-Flash-Next 모델 가중치 공개
Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
Alibaba는 개발자들이 실험하고 평가할 수 있도록 Qwen3.8-Flash-Next의 모델 가중치를 공개했다. 이 모델은 125B 파라미터의 주 모델과 추가로 51B N-그램 임베딩을 포함하는 다중 모달 혼합 전문가(MoE) 모델이다. 각 토큰당 6B 파라미터가 활성화되며, 기본적으로 262,144 토큰의 컨텍스트 윈도우를 제공하고, 최대 1M 토큰까지 확장할 수 있다.
Qwen3.8-Flash-Next는 125B 파라미터와 262,144 토큰의 컨텍스트 윈도우를 제공하여 대규모 데이터 처리에 유용하다.
원문 출처
NVIDIA Technical Blog