Just Keep Prompting: VLM의 반복적 소크라틱 프롬프트 평가
Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs
Vision-Language Models (VLMs)의 실제 배포는 강력한 시각적 추론과 지속적인 대화 압력에 대한 안정성이 필요하다. 'Just Keep Prompting (JKP)'라는 다중 턴 평가 프레임워크가 도입되었으며, 이는 사용자가 모델의 답변을 반복적으로 도전, 질문 또는 반박할 때 VLM의 인식 안정성을 측정한다. JKP는 최대 10회의 후속 턴을 세 가지 전략으로 탐색한다: Adversarial Negation, Pure Socratic Interrogation, Context-Aware Socratic Summarization. GPT-4o, Gemini 2.5 Pro, Qwen3-VL-30B를 STAR 벤치마크의 하위 집합에서 720회의 다중 턴 실행으로 평가한 결과, 정답의 정확도는 턴 0에서 턴 10까지 약간 변화했지만, 모델의 불안정성이 드러났다. Qwen3-VL-30B는 최종 정확도가 가장 높지만 직접적인 반박 시 잘못된 확신을 가지며, Gemini 2.5 Pro는 비교적 안정적이지만 토큰 비용이 높고, GPT-4o는 가장 취약하고 진동성이 크다.
JKP 프레임워크는 VLM의 인식 안정성을 평가하는 새로운 방법론을 제공하며, 모델의 시각적 기초, 보정 및 대화적 준수 간의 균형을 이해하는 데 기여한다.
원문 출처
arXiv cs.CL (계산언어학·NLP)