머신러닝의 여러 갈래 중 지도학습(supervised learning)은 주어진 예측 변수(predicator variable) X와 반응 변수(response variable) Y에 대하여, Y=f(X)를 만족하는 함수 f를 얻는 것이 목표이다(학습). 함수 f는 새로운 데이터 X’에 대한 반응 변수 Y’을 예측하는 데 이용된다(추론). (X, Y는 벡터, 혹은 다차원 행렬일 수 있다.) 잘 학습된 딥러닝 모델이 (입력층을 제외하고) L개의 층을 가지고 있다면, l번째 층은 입력 Y^(l-1)에 대해 출력 Y^(l)을 내보내고, 출력을 계산하는 과정에서 l번째 층의 파라미터 W^(l)이 사용된다.
모델 압축(model compression)은 기존 모델 대비 예측 정확도를 최소한으로 감소시키면서 모델 크기와 연산량을 줄이는 기술이다. 대표적인 모델 압축 기술은 가지치기(pruning), 양자화(quantization), 지식 증류(knowledge distillation)이다. 가지치기는 출생 직후 인간의 뇌에서 뉴런 간 연결이 몇 년간 빽빽해 지다가 어느 순간부터 시간이 지남에 따라 뉴런들의 네트워크가 희박(sparse)해 지는 현상에서 착안한 기술로, 심층 신경망의 각 층마다 파라미터 행렬 W^(l)에서 0이 아닌 작은 값들을 0으로 바꿔 파라미터의 개수를 줄이고 모델을 재학습하는 기술이다. 양자화는 기존 딥러닝 모델의 파라미터 값들이 실수였던 것과는 달리, 파라미터가 가질 수 있는 값들을 두세 가지, 혹은 사전에 정의된 k개로 제한하여 모델을 학습하는 방법이다. 이 기술은 모델을 정규화(regularization)하는 효과가 있어서 일반화 성능이 기존 모델들보다 향상되기도 한다. 지식 증류는, 연산량이 많고 사이즈가 커서 우수한 성능을 보인 교사(teacher) 모델로부터 경량화된 학생(student) 모델을 새롭게 학습하는 방법이다.
신경망의 구조를 변형하여 모델 파라미터의 개수는 줄고 정확도는 오히려 향상하도록 최적 모델을 설계하는 연구도 존재한다. EfficientNet-B0는 2012년 등장한 AlexNet에 비해 top-1 정확도가 15.5% 향상되었고 파라미터 수는 8배로 줄었다.
본 연구에서는 그래프를 압축하는 알고리즘을 주어진 심층 신경망 그래프에 적용하여 경량 심층 신경망을 얻는다. 심층 신경망은 (1) 다수의 입력 노드(input node) 및 은닉 노드(hidden node)들과 (2) 파라미터가 존재하는 두 노드 사이에 (l-1번째 층 노드에서 l번째 층 노드로) 방향 간선(directed edge)을 연결한 그래프(directed acyclic graph)로 표현할 수 있다. 본 연구에서는 그래프에 존재하는 불필요한 중복, 혹은 이 중복에 의존성(dependency)이 있는 노드들을 함께 제거하여 주어진 심층 신경망을 압축한다. 이 기술을 최신 대규모 심층 신경망에 적용해 해당 모델을 경량화한다.