비전 트랜스포머(Vision Transformers, ViTs)가 컴퓨터 비전의 표준 아키텍처로 자리 잡았음에도 불구하고, 이들의 대규모 구조는 상당한 계산 오버헤드를 초래한다. 토큰 압축(token compression) 기법은 이러한 문제를 해결하기 위해 주목받아 왔으나, 대개 심각한 정보 손실을 야기하여 실용적인 성능을 달성하기 위해 광범위한 추가 학습이 필요하다. 본 논문에서는 손실 없는 토큰 병합(lossless token merging)을 보장하여 미세조정(fine-tuning)의 필요성을 제거하면서도 경쟁력 있는 성능을 유지하는 새로운 방법인 적응형 토큰 병합(Adaptive Token Merging, ATM)을 제안한다. ATM은 각 계층(layer)과 배치(batch)에 걸쳐 토큰을 적응적으로 감소시키되, 계층별 유사도 유사도 임계값(layer-specific similarity thresholds)을 신중하게 조정함으로써 각 계층에 대해 유사도가 낮은 토큰들이 병합되는 바람직하지 않은 상황을 방지한다. 또한 ATM은 단순히 유사도뿐 아니라 병합 크기(merging sizes)까지 고려하는 새로운 토큰 매칭(token matching) 기법을 도입하며, 특히 최종 계층들에서 각 병합 연산으로 인해 발생하는 정보 손실을 최소화한다. 우리는 다양한 사전학습(pretrained) 모델 전반에 걸쳐 본 방법을 실험적으로 검증하였고, 그 결과 ATM이 기존의 모든 학습 없이 수행하는(training-free) 방법을 능가할 뿐만 아니라, 추가 학습이 없음에도 불구하고 대부분의 학습을 수반하는 접근법(training-intensive approaches)보다 우수함을 확인하였다. 특히 학습 없이 수행하는 ATM은 DeiT-T 및 DeiT-S 모델에서 원래 정확도 저하 없이 FLOPs를 30% 이상 감소시킨다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.