텍스트-목표 인스턴스 내비게이션(Text-goal instance navigation, TGIN)은 에이전트에게 단일한 자유형 설명을 하나의 행동으로 해결하여, 동일 범주의 방해 인스턴스들 사이에서 올바른 객체 인스턴스에 도달하도록 요구한다. 본 연구에서는 로컬 매칭 단서로부터 전역 탐색의 우선순위를 부여하고 3D 공간 추론을 통해 후보를 검증하는 extit{Context-Nav}를 제안한다. 첫째, 전체 설명에 부합하는 영역으로 탐색을 유도하되 초기 탐지에 머무르지 않도록, 프런티어를 순위화하는 값 맵(value map)에 대해 밀집된 텍스트-이미지 정렬을 계산한다. 둘째, 후보를 관찰한 뒤에는 관점 인식 관계 검사를 수행한다. 에이전트가 그럴듯한 관찰자 자세를 샘플링하고 로컬 프레임을 정렬한 후, 공간적 관계가 적어도 하나의 관점에서 만족될 수 있을 때에만 목표를 수용한다. 이 파이프라인은 과제 특화 훈련이나 미세조정(fine-tuning)을 필요로 하지 않으며, InstanceNav 및 CoIN-Bench에서 최첨단 성능을 달성한다. 제거 실험(ablation) 결과는 (i) 전체 캡션을 값 맵에 인코딩하면 불필요한 이동을 방지할 수 있고, (ii) 명시적 관점 인식 3D 검증이 의미적으로는 그럴듯하지만 잘못된 정지를 막는다는 것을 보여준다. 이는 기하 기반의 공간 추론이 혼잡한 3D 장면에서 세부 인스턴스 구분을 위한 무거운 정책 학습이나 사람-고리(human-in-the-loop) 상호작용에 대한 확장 가능한 대안임을 시사한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.