본 논문에서는 플레이어가 협력하지 않는 시간 슬롯 기반 다중채널 업링크 랜덤 접속(RA) 게임 모델을 제안한다. 먼저 혼잡 게임(Congestion Game, CG) 관점에서 총 처리량을 분석하고, 각 슬롯을 완전히 활용하는 순수전략 내쉬균형(pure strategy Nash equilibria, PNEs)을 도출한다. 다음으로 PNEs을 실현하기 위해 상한 신뢰도(Upper Confidence Bound, UCB) 기반 다중 에이전트 강화학습(Multi-Agent Reinforcement Learning, MARL) 알고리즘을 제안하며, UCB는 각 행동에 대한 신뢰 수준을 부여하여 동작하는 다중 팔 밴딧(multi-armed bandit) 알고리즘 중 하나이다. 마지막으로 시뮬레이션을 통해, 제안한 알고리즘이 장기적으로 거의 최적의 평균 총 처리량을 달성할 수 있음을 보인다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.