3차원 기하와 카메라 운동을 정확하게 추정하면 로보틱스와 자율주행차량에서 다양한 작업을 수행할 수 있다. 그러나 의미(semantics)의 부재와 동적 객체로 인한 성능 저하는 실제 환경에서의 적용을 저해한다. 이러한 한계를 극복하기 위해, 우리는 동시적 VO(visual odometry), 객체 탐지 및 인스턴스 분할(SimVODIS) 네트워크 위에 새로운 신경 의미 시각 오도메트리(VO) 아키텍처를 설계한다. 다음으로, 동적 객체를 처리하고 VO 성능을 향상시키기 위한 다중 과제 학습(multi-task learning) 형태의 주의(attentive) 기반 자세 추정 아키텍처를 제안한다. 본 연구에서 수행한 광범위한 실험 결과는 제안된 SimVODIS++가 동적 환경에서 VO 성능을 향상시킨다는 점을 입증한다. 또한 SimVODIS++는 특징이 없는 영역(feature-less regions)을 제외하면서 두드러진(salient) 영역에 초점을 맞춘다. 실험을 수행하는 과정에서, 선행 다수의 연구들이 따랐던 기존의 실험 설정에서 발생하던 데이터 누출(data leakage) 문제를 발견하고 이를 수정하였다—이를 본 연구의 기여 중 하나로 주장한다. 우리는 소스 코드를 공개한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.