Continuous Audio Thinking(CoAT) 프레임워크를 통한 대규모 오디오 언어 모델 개선
Continuous Audio Thinking for Large Audio Language Models
대규모 오디오 언어 모델(LALMs)은 음성 전사부터 음악 분석에 이르기까지 다양한 오디오 이해 작업에서 뛰어난 성능을 보이고 있다. 그러나 LALMs는 일반적으로 텍스트 정렬 응답을 생성하도록 훈련되어 음향 정보를 보존하기보다 텍스트 생성을 위한 숨겨진 상태로 발전한다. 이를 해결하기 위해 Continuous Audio Thinking(CoAT) 프레임워크가 도입되었으며, 이는 응답 생성을 위한 사전 단계에서 음향 정보를 조직할 수 있는 연속적인 잠재 작업 공간을 제공한다. CoAT는 Qwen2-Audio, Qwen2.5-Omni-7B, Audio Flamingo 3의 세 가지 LALMs에서 오디오 추론, 오디오 이해, 음악 분류, 감정 분석, 음성 전사 등 다양한 벤치마크에서 성능 향상을 보여주었다.
원문 출처
arXiv cs.CL (계산언어학·NLP)