연구 영역
기본 정보
논문·특허
과제
구성원
Article|
·
인용수 0
·2025
The Most Overestimated Q Value Regularization in High-Dimensional Discrete Action Spaces for Offline Reinforcement Learning
S. Yu, Ho-min Park, Byungjin Ko, Jisub Shin, Y. S. Hong, Taejoon Park, Jong‐Won Yoon
IF 8.9 (2025) IEEE Transactions on Neural Networks and Learning Systems
초록

심층 강화 학습(DRL)은 고차원 작용 공간에서 제어 정책을 학습하는 데 뛰어나 로봇 조작에 있어 핵심적이다. 그러나 실제 적용은 비용이 크고 위험한 데이터 수집에 의해 제한된다. 오프라인 강화 학습(offline RL)은 사전 수집된 데이터셋에 대해 학습함으로써 이러한 문제를 해결하지만, 고차원 이산 작용 공간에서의 값 과대추정 문제에 직면한다. 이때 분포 외(out-of-distribution, OOD) 작용의 수가 빠르게 증가하여 훈련 안정성에 부정적 영향을 미친다. 본 연구에서는 가장 과대추정된 값 정규화(Most overestimated value regularization, MQR)를 제안한다. 이는 값이 가장 과대추정된 작용에 패널티를 부여하는 새로운 오프라인 강화 학습 알고리즘으로, 고차원 이산 작용 공간에서의 과대추정을 효과적으로 완화한다. 기존 방법처럼 전체 작용 공간에 대해 균일한 패널티를 적용하는 대신, 값 과대추정의 영향을 가장 크게 받는 작용을 조절함으로써 MQR은 정책이 잘못된 방향으로 수렴하는 것을 추가로 방지한다. MQR은 임의적이고 조밀하며 미지의 물체 배치로 이루어진 시뮬레이션 및 실제 환경에서, 도전적인 고차원 이산 작용 공간 문제인 로봇 밀기 및 집기 작업에 대해 평가하였다. 결과는 MQR이 기준 알고리즘을 유의하게 능가함을 보여주었으며, 시뮬레이션에서 96.94%의 청소(클리어런스) 비율과 실제 환경의 조밀한 구성에서 99.04%를 달성하였다. 또한 높은 작용 효율과 안정성을 유지하였다. 이러한 결과는 로봇 조작을 위한 MQR의 견고성, 확장성, 적응성을 강조하며, 산업용 로봇 공학에서의 실세계 배치 가능성을 시사한다. 본 연구에서 사용한 코드는 https://github.com/Hanyang-Robot/MQR 에서 공개되어 있다.

*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.

키워드
Reinforcement learningRegularization (linguistics)AdaptabilityAction (physics)RoboticsSoftware deploymentValue (mathematics)Flexibility (engineering)
타입
Article
IF / 인용수
8.9 / 0
게재 연도
2025