텍스트-목표 인스턴스 내비게이션(Text-goal instance navigation, TGIN)은 에이전트에게 동일 범주의 교란 요인들(same-category distractors) 중에서 정답 객체 인스턴스에 도달하도록, 하나의 자유 형식 설명을 일련의 행동으로 해석할 것을 요구한다. 우리는 extit{Context-Nav}를 제안하며, 이는 길고 맥락이 포함된 캡션을 로컬 매칭 단서로부터 전역 탐색 우선순위로 끌어올리고 3D 공간 추론으로 후보를 검증한다. 첫째, 우리는 값 맵(value map)에 대해 조밀한 텍스트-이미지 정렬(dense text-image alignments)을 계산하여 프론티어(frontier)를 순위화하고, 초기 탐지에만 부합하는 영역이 아니라 전체 설명과 일치하는 영역으로 탐색을 유도한다. 둘째, 후보를 관찰한 뒤에는 시점(viewpoint)을 인식하는 관계 검증을 수행한다. 에이전트는 그럴듯한 관찰자 자세(observer poses)를 샘플링하고 로컬 좌표계를 정렬한 다음, 최소한 하나의 시점에서 공간적 관계를 만족시킬 수 있는 경우에만 목표를 수용한다. 이 파이프라인은 과제에 특화된 학습이나 파인튜닝을 필요로 하지 않으며, InstanceNav와 CoIN-Bench에서 최첨단 성능을 달성한다. 절제 실험(ablation) 결과는 (i) 전체 캡션을 값 맵에 인코딩하면 불필요한 이동을 방지하고, (ii) 명시적이며 시점-인식적인 3D 검증이 의미적으로 그럴듯하지만 잘못된 정지(Stops)를 막는다는 것을 보여준다. 이는, 기하(geometry)에 기반한 공간적 추론이 복잡한 정책 학습이나 인간-고리(human-in-the-loop) 상호작용 없이도 혼잡한 3D 장면에서 세부 인스턴스 모호성 해소를 위한 확장 가능한 대안이 될 수 있음을 시사한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.