빠르게 발전하는 강화학습(Reinforcement Learning, RL) 분야에서, 다중 에이전트 강화학습(Multi-Agent Reinforcement Learning, MARL)은 복잡한 현실 문제를 해결하는 핵심 분야로 부상해 왔다. 이 영역에서의 중요한 발전 중 하나는 혼합 네트워크(mixing network)의 도입으로, 다중 에이전트 시스템의 역량을 크게 향상시키는 전환점이 되었다. COMA 및 VDN 방법론에서 영감을 받아, 혼합 네트워크는 공동 상태-행동 상호작용으로부터 결합된 Q값을 추출하는 데 있어 기존 기법들의 한계를 극복한다. COMA와 VDN과 같은 선행 접근법은 학습 과정에서 상태로 제공되는 정보를 충분히 활용하지 못한다는 제약을 지녔으며, 이로 인해 효과성이 제한되었다. QMIX와 QVMinMax는 중앙집중형 상태를 두 번째 신경망을 위한 가중치로 변환하기 위해 신경망을 사용함으로써(하이퍼 네트워크와 유사) 이러한 문제를 해결하고자 했다. 그러나 이러한 해결책들은 계산적으로 부담이 크고 국소 최솟값(local minima)에 취약하다는 어려움을 동반하였다. 이러한 난관을 극복하기 위해, 본 연구에서 제안하는 방법론은 세 가지 핵심 기여를 도입한다. 첫째, 전통적인 혼합 방식의 혁신적 대안으로 자기-어텐션(self-attention) 메커니즘을 갖는 상태-융합 네트워크(state- fusion network)를 제안한다. 둘째, MARL 알고리즘에서의 국소 최적(local optima) 문제를 해결하기 위해, 가중치와 바이어스 선택에 Grey Wolf Optimizer를 활용하여 최적화 성능을 개선하기 위한 확률적 요소를 추가한다. 마지막으로, QMIX와의 성능을 두 가지 최적화 방법(Gradient Descent 및 Stochastic Optimizer) 하에서 종합적으로 비교한다. 실험 플랫폼으로 StarCraft II Learning Environment(SC2LE)를 사용한 결과, 본 방법론은 절대 성능에서 QMIX, QVMinMax, QSOD에 비해 우수함을 보였으며, 특히 자원 제약이 있는 환경에서 그 우월성이 두드러졌다. 본 연구의 방법론은 어텐션 메커니즘과 최적화 전략의 발전을 통해 다중 에이전트 시스템의 역량을 향상시키며, MARL 기법의 지속적인 진화에 기여한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.