머리 자세 추정은 인간-컴퓨터 상호작용에서 여러 응용을 위한 기본 기능이다. 전 범위 각도를 포함한 정확한 6자유도(6DoF) 머리 자세 추정(6DoF-HPE)은 이러한 응용의 대부분을 구성하며, 이는 입력으로 인간 머리의 연속 영상을 필요로 한다. 기존 대부분의 머리 자세 추정 방법은 3자유도(3DoF) 정면 머리에 초점을 맞추고 있어 실제 환경에서의 적용을 제한한다. 본 연구는 랜드마크 국소화 없이 머리 자세를 추정하도록 설계된 프레임워크를 제시한다. 우리의 프레임워크의 참신성은 전 범위 각도에서 6DoF 머리 자세를 실시간으로 추정한다는 점에 있다. 제안된 프레임워크는 딥 뉴럴 네트워크를 활용하여 인간 머리를 검출하고, 각각 Single Shot MultiBox Detector(SSD)와 RepVGG-b1g4 백본을 이용해 그 각도를 예측한다. 본 연구는 카메라 자세에 대한 회전 및 이동 성분을 추정하기 위해 적색, 녹색, 청색 및 깊이(RGB-D) 데이터를 사용한다. 제안된 프레임워크는 각도를 예측하기 위한 연속 표현을 사용하며, 학습 전략을 위한 손실 함수를 업데이트하기 위해 다중 손실 접근법을 적용한다. 회귀 함수는 지오데식 손실과 평균제곱오차를 결합한다. 정답 라벨은 전 범위 머리 각도를 위해 공개 데이터셋인 Carnegie Mellon University(CMU) Panoptic에서 추출하였다. 본 연구는 공개 벤치마크 데이터셋을 사용하여 최신 기법들과의 포괄적인 비교를 제공한다. 실험 결과, 제안된 방법은 최신 기법과 동등하거나 이를 능가하는 성능을 달성함을 보여준다. 코드는 데이터셋과 함께 다음에서 제공된다: (github after accepting).
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.