Efficient Transformers via Pruning, Token Merging, and Sparsification
연구 내용
Transformer의 추론 비용을 줄이기 위해 one-shot pruning과 lossless token merging을 설계하는 연구
본 연구는 Transformer의 높은 계산량과 메모리 사용 문제를 해결하기 위해 압축을 학습 설계의 중심에 둡니다. BERT에서는 weight grouping과 permutation을 통해 중요 가중치 구조를 한 번에 정렬·선별하는 semi-structured one-shot pruning을 구성하여, 반복적 가지치기와 정교한 학습 절차의 부담을 낮춥니다. Vision Transformer에서는 fine-tuning 없이 동작하는 lossless token merging을 목표로, 층과 배치에 따른 similarity threshold를 조절해 불필요한 병합을 억제합니다. 또한 모델 inversion에서는 Patch Rebirth 개념으로 희소 합성 입력을 점진적으로 갱신하여 계산 효율과 지식 추출의 균형을 맞추는 방식으로 확장합니다.
관련 연구 성과
관련 논문
0편
관련 특허
0건
관련 프로젝트
0건
연구 흐름
초기에는 pretrained 모델에서 가지치기와 압축이 성능에 미치는 영향과 구조적 제약을 정리하고, BERT에 대한 one-shot pruning 설계를 통해 절차 복잡도를 줄이는 방향을 확립합니다. 이후 Transformer 계열 전반으로 확장하면서 토큰 병합이 정보 손실을 유발하지 않도록 층별 기준과 병합 규칙을 설계하는 연구를 수행합니다. 동시에 vision transformer 기반 모델 inversion으로 확장하여, patch 선택을 조기에 고정하지 않고 점진적으로 갱신하는 방식으로 계산량을 낮추는 흐름을 이어갑니다. 최근에는 압축·희소화의 일반성을 검증하며 성능-효율 트레이드오프를 안정화하는 방향으로 연구를 구체화합니다.
활용 가능성
활용 가능성은 알앤디써클 특화 AI 에이전트가 생성한 내용으로, 실제 연구 가능 여부는 연구실과의 논의가 필요합니다.