장면 이해는 맥락 정보를 추출하고 의사결정을 수행하기 위해 감각 데이터를 활용함으로써 자율주행에서 핵심적인 역할을 한다. 모델링의 진전과 더불어, 차량이 주변 환경을 인지할 수 있게 하는 기반은 시각 감각 데이터의 가용성이며, 이는 차량 지각을 확장하고 실제 환경에서의 차량적 맥락 인식을 실현한다. 관련 연구들이 추구해 온 장면 이해의 연구 방향에는 인물/차량 검출 및 분할, 그들의 전이(transition) 분석, 차선 변경 및 회전(turns) 검출 등 여러 과제가 포함된다. 그러나 이러한 과제들은 완전 자율주행 차량, 즉 사람에 의해 제어되는 차량처럼 주행하여 레벨-5 자율성을 달성하는 것을 완전히 구현하기에는 불충분해 보인다. 이와 같은 후자의 진술은 본 리뷰 논문에서 도출된 결론 가운데 하나로, 비전 센서를 사용하는 자율주행차의 장면 이해는 여전히 상당한 개선이 필요하다고 한다. 이러한 동기에서, 본 조사는 대부분이 계산적으로 복잡한 딥러닝 모델에 의존하는 장면 이해 연구 분야의 현재 성과를 정의하고, 분석하며, 검토한다. 또한 범용 장면 이해 파이프라인을 다루고, 최신 기술( state-of-the-art )에서 보고된 성능을 조사하며, 최첨단 모델링 선택지에 대한 시간 복잡도 분석을 제공하고, 현행 연구 노력에서 마주친 주요 성과와 주목할 만한 한계를 부각한다. 아울러 본 조사는 이용 가능한 데이터셋에 대한 포괄적인 논의를 포함하고, 최근까지 연구자들이 직면해 왔음에도 불구하고 오늘날까지도 미해결로 남아 있는 과제들을 다룬다. 마지막으로, 본 연구는 이 흥미로운 영역에 연구자와 실무자들이 참여할 수 있도록 향후 연구 방향을 제시한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.