VICIS: 이미지 세트에서 시각 개념 추론하기
Show Me Examples: Inferring Visual Concepts from Image Sets
Vision-language models (VLMs)는 복잡한 텍스트 지시를 따를 수 있지만, 순수한 시각적 맥락에서 추론하는 데 어려움을 겪는다. 현재 모델은 예시 이미지 세트에서 공유 개념을 추론하고 이를 새로운 입력에 적용하는 데 실패한다. 이에 따라 Visual Concept Inference from Sets (VICIS)라는 작업이 도입되었으며, 이는 모델이 개념을 정의한 맥락을 유지하면서 쿼리 이미지와 일치하는 새로운 이미지를 생성해야 하는 능력을 평가한다. 최신 VLM들이 이 작업에서 성능이 저조하다는 결과를 보여준다.
VICIS는 VLM의 시각적 맥락 이해 능력을 평가하는 새로운 기준을 제시한다.
원문 출처
Apple Machine Learning Research