조류의 시점(Bird’s Eye View, BEV) 공간에서의 최근 센서 퓨전은 3D 검출, 맵 분할 등 다양한 과제에서 그 유용성을 입증하였다. 그러나 이러한 접근은 부정확한 카메라 BEV 추정과, LiDAR 포인트의 희소성으로 인해 원거리 영역을 인식하는 데 어려움을 겪는다. 본 논문에서는 미리 정의된 BEV 범위 내에서 카메라 BEV 추정을 향상시켜 광범위한 인식을 달성하는 동시에, 전체 BEV 공간에서 LiDAR의 희소성을 보완하는 것을 목표로 하는 BEV 퓨전(BroadBEV)을 제안한다. 이를 위해 LiDAR BEV 분포를 카메라의 깊이 분포로 산란시키는 Point-scattering을 설계한다. 이 방법은 카메라 분기의 깊이 추정 학습을 향상시키고, BEV 공간에서 조밀한 카메라 특징의 정확한 위치 선정을 유도한다. 공간적으로 동기화된 특징 간의 효과적인 BEV 퓨전을 위해, LiDAR 및 카메라 BEV 특징에 대해 서로의 self-attention 가중치를 적용하는 ColFusion을 제안한다. 광범위한 실험 결과, 제안한 방법들은 뛰어난 성능 향상과 함께 광범위한 BEV 인식을 가능하게 함을 보여준다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.