미니맥스, 텍스트·오디오 통합 멀티모달 영상 생성 모델 'H3' 공개
미니맥스, 텍스트·오디오 통합 멀티모달 영상 AI 'H3' 공개... "오픈웨이트로 시댄스에 도전"
미니맥스가 텍스트와 이미지, 영상, 오디오를 처리하는 멀티모달 영상 생성 모델 'H3'를 발표했다. H3는 아티피셜 애널리시스의 벤치마크에서 최상위권을 기록했으며, 바이트댄스의 '시댄스'와 경쟁할 수 있다는 평가를 받고 있다. 미니맥스는 H3의 모델 가중치를 커뮤니티 라이선스로 공개할 계획이다.
H3는 텍스트와 오디오를 통합하여 다양한 멀티모달 콘텐츠 생성에 활용될 수 있다.
원문 출처
AI타임스