VGG-MADiffRL을 활용한 다중 AUV 기반 목표 추적 시스템
Multi-AUV Ad-hoc network-based Target Tracking: A Value Gradient Guidance Multi-Agent Diffusion Reinforcement Learning Approach
다중 AUV(ad-hoc network) 기반 목표 추적은 제한된 음향 통신, 동적 토폴로지, 불확실한 해양 교란 속에서 자율 수중 차량(AUV)들이 협력적으로 목표를 추적하는 것을 요구한다. 기존의 다중 에이전트 강화 학습(MARL) 방법은 고차원 상태-행동 모델링과 노이즈에 민감한 정책 생성으로 인해 훈련이 불안정하고 추적 성능이 저하되는 문제를 겪는다. 이를 해결하기 위해 VGG-MADiffRL이라는 가치 기울기 기반 다중 에이전트 확산 강화 학습 알고리즘과 MDCA라는 확산 기반 계층 제어 구조를 제안한다. MDCA는 글로벌 지능 제어 계층, 로컬 온라인 훈련 계층, 물리적 행동 실행 계층으로 구성된 세 가지 계층의 폐쇄 루프 제어 구조를 갖추고 있으며, VGG-MADiffRL은 확산 정책을 기반으로 가치 기울기를 활용하여 행동 생성을 유도한다. 실험 결과, VGG-MADiffRL은 협력적 추적 시나리오에서 더 빠른 수렴, 높은 추적 정확도, 부드러운 훈련 동역학을 달성하였다.
VGG-MADiffRL은 가치 기울기를 활용하여 행동 생성을 유도함으로써 다중 AUV의 목표 추적 성능을 향상시킨다.
원문 출처
arXiv cs.LG (머신러닝)