GLM 5.3의 새로운 포스트 트레이닝 스케일링 법칙과 Z.ai CEO Jie Tang의 의견
[AINews] Death of Params: Z.ai CEO Jie Tang on GLM 5.3 and the new Post-training Scaling Law
Jie Tang 교수는 GLM 5.3의 발전이 RL을 통한 긴 수명 환경에서 이루어졌다고 설명하며, 이 환경은 실제 엔지니어링 및 연구 작업을 반영한 다양한 프로덕션 워크플로우를 포함한다고 언급했다. GLM-5.3은 모델이 문제를 분해하고 각 단계를 감독하는 대신, 엔지니어와 동일한 작업 환경에서 훈련되어 전체 작업을 책임지는 방향으로 발전하고 있다. Tang 교수는 파라미터 수 외에도 데이터 양, 컴퓨팅 비용, 모델 운영 조건이 중요하다고 강조했다.
GLM-5.3은 RL을 통해 실제 엔지니어링 환경에서 훈련되어, 모델이 엔지니어와 유사한 작업을 수행할 수 있도록 설계되었다.
원문 출처
Latent Space (swyx & Alessio)