자연어 처리(NLP)에서 트랜스포머(Transformer)는 널리 사용되고 있으며 언어 모델링, 요약, 분류와 같은 여러 NLP 과제에서 이미 최첨단 수준에 도달하였다. 또한 변분 오토인코더(variational autoencoder, VAE)는 표현 학습에서 효율적인 생성 모델로서, 인코딩된 표현에서의 통계적 추론과 딥러닝을 결합한다. 그러나 자연어 처리에서 VAE를 사용하는 경우에는 후방 붕괴(posterior collapse)라고도 알려진 쿨백–라이블러(Kullback–Leibler, KL) 소실(KL vanishing)과 같은 실질적인 어려움이 자주 발생한다. 이 문제를 완화하기 위하여, 언어 데이터 처리의 병렬화(parallelization) 이점을 활용하는 한편, 서로 다른 두 가지 딥러닝 모델을 통합하는 형태로서, 변분 오토인코더와만 결합된 트랜스포머 모델로 이루어진 새로운 언어 표현 모델을 제안한다. 제안한 모델을 VAE가 순환신경망(recurrent neural network, RNN)과 연결된 기존 연구 등과 비교한다. 실제 데이터셋 4개에 대한 실험 결과, KL annealing을 적용하는 구현이 후방 붕괴를 완화함을 확인하였다. 또한 결과는 제안한 트랜스포머 모델이 재구성과 표현 학습에서 RNN 기반 모델보다 우수하며, 제안 모델의 인코딩된 표현이 시험한 다른 모델의 표현보다 더 유익하다는 점을 보여준다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.