RL-파인튜닝된 VLM의 강건성과 사고 일관성
On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
강화 학습(RL) 파인튜닝은 추론 집약적 작업에서 대형 언어 모델(LLM)을 향상시키기 위한 주요 기술로, 비전 언어 모델(VLM)로의 확장이 필요하다. RL로 조정된 VLM은 시각적 추론 벤치마크에서 개선되지만, 약한 시각적 기초, 환각, 텍스트 단서에 대한 과도한 의존성에 취약하다. 간단한 텍스트 교란, 즉 오해를 불러일으키는 캡션이나 잘못된 사고 과정(Chain-of-Thought, CoT) 추적이 강건성과 신뢰도에 상당한 하락을 초래하며, 이러한 효과는 CoT 일관성이 낮을 때 더욱 두드러진다.
이 연구는 VLM의 신뢰성과 강건성을 높이기 위한 개선 방향을 제시한다.
원문 출처
Apple Machine Learning Research