본 연구는 시간 슬롯 할당 방식의 RA(랜덤 액세스) 시스템을 위한 랜덤 액세스(RA) 게임을 조사한다. 이때 명의 플레이어가 프레임의 슬롯 집합을 선택하며, 각 프레임은 개의 다중 시간 슬롯으로 구성된다. 본 연구에서는 중앙 집중형 스케줄링에서처럼 슬롯이 완전히 활용되는 조건에서, 이 RA 게임의 순수 전략 내쉬 균형(PNE, pure strategy Nash equilibria)을 구한다. PNE(순수 전략 내쉬 균형)를 실현하기 위한 알고리즘으로서, 탐색과 활용(Exploration and Exploitation)을 위한 지수 가중(Exponential-weight) 알고리즘 기반의 다중 에이전트(MA) 학습 알고리즘을 제안하며, 그 계산 복잡도는 $O(N N_{ max }^{2} T)$ 이다. EXP3는 다중 팔 밴딧(MAB) 문제에서, 사용자들이 각 전략의 기대 보상을 알지 못하는 상황에서 최적 전략을 찾도록 설계된 밴딧 알고리즘이다. 시뮬레이션 결과는 제안된 알고리즘이 PNE를 달성할 수 있음을 보여준다. 또한 플레이어의 수가 시간에 따라 변하는 시간 가변 환경(time-varying environments)에 적응할 수 있다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.