현재의 3D 장면 그래프 생성(3DSGG) 접근법은 단일 에이전트 가정과 소규모 환경에 크게 의존하고 있어 실제 세계 시나리오로의 확장성이 제한적이다. 본 연구에서는 다중 에이전트를 활용하여 이러한 확장성 문제를 해결하도록 설계된 최초의 프레임워크인 Multi-Agent 3D Scene Graph Generation(MA3DSG) 모델을 제안한다. 우리는 학습이 필요 없는 그래프 정렬(graph alignment) 알고리즘을 개발하여, 각 에이전트로부터 생성된 부분 질의 그래프를 효율적으로 병합해 하나의 통합된 전역 장면 그래프(global scene graph)로 구성한다. 광범위한 분석과 경험적 통찰을 바탕으로, 본 접근법은 어떠한 학습 가능한 매개변수도 요구하지 않으면서 기존의 단일 에이전트 시스템이 협력적으로 동작할 수 있도록 해준다. 3DSGG 성능을 엄밀하게 평가하기 위해, MA3DSG-Bench-a 벤치마크를 제안하며, 이는 다양한 에이전트 구성, 도메인 규모, 환경 조건을 지원함으로써 보다 일반적이고 확장 가능한 평가 프레임워크를 제공한다. 본 연구는 확장 가능한 다중 에이전트 3DSGG 연구를 위한 탄탄한 기반을 마련한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.