최근 인공지능의 발전은 뇌 신호로부터 인간의 시각 시스템을 이해하고 해독하려는 수많은 시도를 촉진해 왔다. 이러한 선행 연구들은 대체로 사전 학습된 비전 모델을 사용하여 이미지에서 추출한 의미적 및 지각적 특징에 대해 신경 활동을 독립적으로 정렬시키는 방식으로 수행되었다. 그러나 두 가지 핵심 과제를 충분히 고려하지 못한다: (1) 뇌 신호와 이미지 사이에서 나타나는 표현 수준의 정보량 차이로부터 비롯되는 모달리티 갭(modality gap), 그리고 (2) 신경 활동 내에서 의미적 특징과 지각적 특징이 고도로 얽혀 있다는 사실이다. 이러한 문제를 해결하기 위해, 우리는 정보량의 차이를 고려하는 데 적합한 초볼록 공간(hyperbolic space)을 활용한다. 초볼록 공간은 두 점 사이의 지오데식(geodesics)이 표현 능력이 더 낮은 원점(origin)으로 자연스럽게 휘어지는 기하학적 성질을 가진다. 이러한 성질을 바탕으로, 의미적 시각 특징과 지각적 시각 특징 사이를 초볼록 지오데식(hyperbolic geodesics) 따라 보간하는 새로운 프레임워크인 Hyperbolic Feature Interpolation(HyFI)를 제안한다. 이를 통해 지각적 정보와 의미적 정보의 결합 및 압축이 모두 가능해지며, 뇌 신호의 제한된 표현력과 이들 특징이 얽혀 있는 성격을 효과적으로 반영한다. 그 결과 뇌와 시각 특징 간의 더 나은 정렬을 촉진한다. 우리는 HyFI가 제로샷 뇌-이미지 검색(zero-shot brain-to-image retrieval)에서 최첨단 성능을 달성함을 보여주며, THINGS-EEG에서 Top-1 정확도 기준으로 최대 +17.3%, THINGS-MEG에서 +9.1%까지 기존 방법을 능가한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.