경로 탐색 문제 해결을 위한 심층 강화학습(DRL)은 최근 연구에서 유망한 성과를 보였다. 그러나 계산 기반 DRL과 최적화 기반 휴리스틱 사이에는 본질적인 격차가 존재한다. 특정 문제에 대한 DRL 알고리즘은 여러 유사 문제 인스턴스를 해결할 수 있는 반면, 전통적인 최적화 알고리즘은 하나의 특정 문제 인스턴스에 대한 해를 최적화하는 데 초점을 둔다. 본 논문에서는 강화학습과 최적화 사이의 격차를 연결하면서 경로 탐색 문제를 해결하는 접근법 AlphaRouter를 제안한다. 경로 탐색 문제에 맞추어, 본 접근법은 모든 가능한 노드에 대한 확률 분포를 산출하는 정책 네트워크와 임의의 주어진 상태로부터의 기대 거리를 산출하는 가치 네트워크로 구성된 주의(attention) 기반 정책 및 가치 네트워크를 먼저 제안한다. 또한 경로 탐색 문제에 대해 몬테카를로 트리 탐색(MCTS)을 수정하고, 이를 경로 탐색 문제에 선택적으로 결합한다. 실험 결과, 결합된 접근법은 유망하며, MCTS 없이 적용한 기존 강화학습(RL) 접근법에 비해 더 나은 해를 도출하고, 고전적 휴리스틱과 비교할 만한 수준의 성능을 보임을 확인하였다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.