본 연구는 장기(롱호라이즌) 과제에서 강화학습(RL)의 안정성과 성능을 향상시키기 위한 새로운 접근법을 제안한다. 가치함수 추정에서의 과대추정 편향과 환경 내 높은 불확실성은 최적의 행동을 결정하기 어렵게 만든다. 이를 해결하기 위해 우리는 로봇 응용에서 불확실성을 관리하는 방식으로 truncated quantile critics 알고리즘을 개선한다. 우리의 동적 방법은 정책 엔트로피에 따라 할인율을 조정하여, 에이전트의 학습 상태를 반영하는 세밀한 튜닝이 가능하도록 한다. 이를 통해 기존 알고리즘은 제한된 학습 데이터가 있는 상황에서도 안정적으로 학습할 수 있으며, 보다 견고한 적응을 보장한다. 정책 엔트로피 손실을 활용함으로써, 이 접근법은 미래 보상의 예측에 대한 신뢰도를 효과적으로 향상시킨다. 실험 결과, DeepMind Control Suite 및 Gymnasium 로보틱스 환경에서 기존의 고정 할인율 접근법에 비해 평균 평가 수익이 11% 증가함을 확인하였다. 본 접근법은 복잡한 장기 과제에서의 샘플 효율성과 적응성을 유의미하게 향상시키며, 도전적이고 불확실한 환경에서의 탐색에 있어 엔트로피 유도 RL의 효과를 잘 보여준다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.