LMMs(대규모 다중 모달 모델)의 필요성과 활용
Multimodality and Large Multimodal Models (LMMs)
기존의 ML 모델은 텍스트, 이미지, 오디오 중 하나의 데이터 모드에서만 작동했으나, 인간의 자연 지능은 여러 모달리티를 활용한다. OpenAI는 GPT-4V 시스템 카드에서 LLMs에 이미지 입력과 같은 추가 모달리티를 통합하는 것이 AI 연구의 중요한 경계로 여겨진다고 언급했다. LMMs는 LLMs에 추가 모달리티를 통합한 모델로, 텍스트-이미지 변환 모델인 Midjourney, Stable Diffusion, Dall-E와는 다르다. LMMs는 다양한 입력과 출력을 처리할 수 있으며, CLIP과 Flamingo와 같은 시스템이 그 기초를 제공하고 있다.
다양한 데이터 모달리티를 처리할 수 있는 LMMs는 의료, 로봇 공학, 전자 상거래 등 여러 산업에서 필수적인 활용 사례를 가능하게 한다.
원문 출처
Chip Huyen