Qwen-Drive-1.0: 자율주행을 위한 비전-언어 모델
Qwen/Qwen-Drive-1.0-4B · Hugging Face
Qwen은 자율주행을 위한 비전-언어 모델인 Qwen-Drive-1.0을 발표했다. 이 모델은 3D 인식, 시각적 질문 응답, 동작 계획을 통합한 구조를 가지고 있으며, 외부의 조감도(BEV) 인식 헤드를 통해 3D 객체 탐지, 의미론적 점유 예측 및 BEV 맵 분할을 수행한다. 또한, 주행 감독과 일반 비전-언어 데이터를 결합한 단계적 훈련 방법을 통해 주행 관련 능력을 습득하면서도 폭넓은 시각적 이해와 지시 따르기 능력을 유지한다.
원문 출처
r/LocalLLaMA