전문가 시연에 국한된 자료 지원으로 인해 로봇 학습에서의 행동 복제(behavior cloning) 방법은 일반화 성능이 낮다. 최근에는 대규모 데이터셋으로부터 풍부한 시공간 표현을 학습하는 비디오 예측 모델을 활용한 접근들이 유망한 결과를 보였다. 그러나 이러한 모델은 서로 다른 제어 입력을 구별할 수 없는 작용-비구분(action-agnostic) 동역학을 학습하므로, 정밀 조작 과제에 대한 활용성이 제한되며 대규모 사전학습 데이터가 필요하다. 본 연구는 정책 학습에 동역학 예측을 통합하는 Dynamics-Aligned Flow Matching Policy (DAP)를 제안한다. 우리의 방법은 행동 생성 과정에서 정책 모델과 동역학 모델이 상호 교정 피드백을 제공하도록 하는 새로운 구조를 도입하여, 자기 보정과 향상된 일반화를 가능하게 한다. 실증적 검증 결과, 실제 로봇 조작 과제에서 기본 방법들에 비해 일반화 성능이 우수함이 입증되었으며, 시각적 방해와 조명 변화가 포함된 OOD(out-of-distribution) 시나리오에서도 특히 견고함을 보였다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.