BERT와 같은 대규모 사전학습 언어 모델은 방대한 크기 때문에 추론 속도가 느리고 메모리 사용량이 높다. 최근의 BERT 압축 기법들은 반복적 가지치기와 지식 증류에 의존하는 경우가 많지만, 이는 종종 지나치게 복잡하고 계산 비용이 크다. 본 논문에서는 BERT를 위한 새로운 반(半)구조화 일괄(one-shot) 가지치기 방법인 Permutation and Grouping for BERT(PGB)를 제안하며, 이는 정확도를 보존하면서 높은 압축 효율과 희소성을 달성한다. 이를 위해 PGB는 순열(permutation)을 통해 개별 가중치의 중요한 그룹을 식별하고, 다중 헤드 어텐션 및 피드포워드 층 모두에서 다른 모든 가중치를 구조로서 가지치기한다. 또한 특정 층에서 중요한 그룹이 형성되지 않으면, PGB는 해당 층 전체를 제거하여 더 한층 더 압축된 모델을 생성한다. BERTBASE에 대한 실험 결과, PGB는 계산 비용과 정확도 보존 측면에서 최첨단의 구조화 가지치기 방법들을 능가함을 보여주었다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.