NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B 모델 출시
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-BF16 · Hugging Face
NVIDIA가 개발한 Nemotron-Labs-3-Puzzle-75B-A9B 모델은 Nemotron-3-Super-120B-A12B에서 파생된 대형 언어 모델로, Iterative Puzzle이라는 포스트 트레이닝 압축 프레임워크를 사용하여 추론 효율성을 개선하고 강력한 정확도를 유지한다. 이 모델은 하이브리드 MoE 아키텍처를 채택하고 있으며, Multi-Token Prediction(MTP)을 지원하여 텍스트 생성 속도를 높인다. Puzzle-75B-A9B는 120.7B에서 75.3B로 모델 크기를 줄였으며, 단일 8×B200 노드에서 서버 처리량이 약 2배 증가하고, 1M-token 단일-H100 동시 처리 요청이 1에서 8로 증가한다. 지원 언어는 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 스페인어, 중국어가 포함된다.
Puzzle-75B-A9B는 단일 8×B200 노드에서 서버 처리량을 약 2배 증가시켜 효율적인 모델 운영이 가능하다.
원문 출처
r/LocalLLaMA