최근 비전-언어 모델(Vision-Language Models, VLMs)은 다양한 과제에서 인상적인 성능을 달성했으나, 대량의 시각 토큰으로 인해 계산 비용이 높다는 한계가 있다. 다양성 기반 토큰 선택 방법은 중복성을 효과적으로 줄이지만, 토큰 예산이 타이트한 경우 종종 공간 커버리지를 잃는다. 이러한 문제를 해결하기 위해, 우리는 각 그리드 영역이 최소 하나의 대표 토큰을 제공하도록 보장함으로써 균형 잡힌 공간 커버리지를 강제하는 경량 모듈인 그리드 기반 다양성 강화(Grid-based Diversity Enhancement, GDE)를 제안한다. 는 최소한의 오버헤드로 기존의 다양성 기반 프레임워크에 손쉽게 통합될 수 있다. LLaVA-1.5-7B를 사용한 이미지 이해 벤치마크에 대한 실험에서 는 일관되게 성능을 향상시키며, 단지 128 토큰만으로도 기본(vanilla) 모델 정확도의 를 달성한다. 이러한 결과는 가 전역 시각적 문맥을 효과적으로 보존하고, 극단적 압축 하에서 효율성과 정확도 간 더 나은 절충을 달성함을 보여준다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.