소셜 네트워크 서비스 플랫폼에서 범죄 용의자는 기존 단어에 범죄의 의미를 덧붙이거나 유사한 단어로 대체함으로써, 의사소통에 사이버범죄 암호화 단어를 사용할 가능성이 높다. 예를 들어, ‘ice’라는 단어는 마약 범죄에서 종종 메스암페타민을 의미하는 데 사용된다. 사이버범죄의 특성과 범죄자의 행태를 분석하기 위해서는, 이러한 단어를 신속하게 탐지하고 나아가 그 의미를 더 잘 이해하는 것이 중요하다. 자동화된 사이버범죄 암호화 단어 탐지 문제에서는, 지도학습을 위한 충분한 양의 학습 데이터를 수집하기 어렵고, 문맥 정보를 활용해 자연어를 더 잘 이해하는 언어 모델을 그대로 적용하기도 어렵다. 이러한 한계를 극복하기 위해, 우리는 새로운 2단계 접근법을 제안한다. 1단계에서는 다섯 가지 서로 다른 AutoEncoder 모델 중 하나를 통해 각 사이버범죄에 대한 평균 잠재 벡터(mean latent vector)를 구성하고, 2단계에서는 다층적 잠재 표현(multi-level latent representations)을 기반으로 사이버범죄 암호화 단어를 탐지한다. 또한, 이 2단계 접근법을 통해 탐지된 사이버범죄 암호화 단어를 보다 깊이 이해하기 위해, 다음의 세 가지 새로운 방법을 제안한다: (1) 최근에 새로 만들어진 신조어(new words) 탐지, (2) 마약 범죄와 성범죄 모두에서 빈번히 등장하는 단어 탐지, (3) 단어 계통도(word taxonomy)의 자동 생성. 우리의 실험 결과에 따르면, 다양한 AutoEncoder 모델 중에서 stacked AutoEncoder 모델이 가장 우수한 성능을 보였다. 더불어, 2단계 접근법의 F1-score는 0.991로, 기존 dark-GloVe 및 dark-BERT 모델의 0.987 및 0.903보다 높다. 또한, 제안한 세 가지 방법의 실험 결과를 분석함으로써 마약 범죄와 성범죄를 보다 깊이 이해할 수 있다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.