Ling-3.0-flash-VL 모델의 이미지 및 비디오 이해 기능
inclusionAI/Ling-3.0-flash-VL · Hugging Face
Ling-3.0-flash-VL은 124B의 총 파라미터를 가진 모델로, 1M 토큰까지의 컨텍스트 윈도우를 지원하며, 이미지와 비디오 이해 기능을 확장하여 언어, 추론 및 긴 컨텍스트 기능을 계승한다. 이 모델은 ViT 비주얼 인코더를 통해 이미지와 비디오에서 특징을 추출하며, VideoRoPE를 사용하여 시각적 변화 이해를 지원한다. 또한, 42-layer 하이브리드 백본과 희소 MoE 아키텍처를 통해 효율적인 멀티모달 처리 기능을 제공한다.
Ling-3.0-flash-VL은 124B의 총 파라미터를 통해 강력한 멀티모달 기능을 제공하며, 비주얼 정보와 텍스트 표현을 통합하여 실제 세계의 추론을 가능하게 한다.
원문 출처
r/LocalLLaMA