개방 세계 객체 탐지(open-world object detection, OWOD)는 모델이 확장되는 알려진 범주 집합을 인식하는 동시에 이전에 보지 못한 객체를 새로 발견해야 하는 동적 환경으로 전통적 탐지를 확장한다. 기존 OWOD 방법들은 클래스 비구분(class-agnostic) 제안에서 객체성 점수를 임계값 처리하여 미지의 대상을 채굴하지만, 이는 라벨 편향을 유발한다. 즉, 알려진 범주의 외형에서 벗어난 새로운 객체는 배경으로 억제되는 반면, 복잡한 배경은 미지의 탐지를 허위로 유발할 수 있다. 이러한 한계를 극복하기 위해, 제안된 REConstruction-Error Density + Contrastive Quality Architecture(RcCOnQA)는 재구성 오차 밀도(reconstruction-error density, RED) 모델링을 통해 객체성으로부터 의사 라벨 생성을 분리한다. 경량 Transformer 오토인코더가 고정된 백본+특징 피라미드 네트워크(Feature Pyramid Network, FPN) 특징을 재구성하고, 앵커(anchor)별 잔차 맵(residual maps)을 생성한다. 이어서 조밀도(density) 헤드는 정규화된 잔차를 연속적인 ‘unknownness(미지성)’ 점수로 변환한다. 이러한 점수는 객체 위치 추정 네트워크(object-localization network, OLN) 분기와 대조적 Quality Head를 강화한 자기학습(self-training) 탐지기에 지침을 제공하며, 정밀한 의사 라벨 정제와 재앙적 망각(catastrophic forgetting) 없이 태스크-증분 학습(task-incremental learning)을 가능하게 한다. Open-World Object Detection Benchmarks(OWODB)에서의 실험—상위 클래스가 분리된 분할(superclass-separated split; S-OWODB)과 상위 클래스가 혼합된 분할(superclass-mixed split; M-OWODB)—에서는, 최첨단 OWOD 접근법에 비해 알려지지 않은 객체의 리콜(unknown recall)은 크게 향상되면서 알려진 클래스의 평균 정밀도(mean Average Precision, mAP)는 보존됨을 보여준다. Large Vocabulary Instance Segmentation(LVIS) 및 Objects365에 대한 교차 데이터셋 평가와 의미적 관련성 연구는, 진정으로 분포 밖(out-of-distribution) 객체에 대한 강건한 일반화를 확인한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.