목적: 머신러닝(ML)은 자살 위험을 예측하고 관련 위험 요인을 파악하는 데 도움을 줄 수 있다. 더 나은 성능을 갖는 ML 예측 모델을 개발하기 위해서는 다양한 리샘플링 방법과 알고리즘을 적용해야 한다. 본 연구에서는 다섯 가지 ML 알고리즘, 미샘플 데이터, 그리고 두 가지 리샘플링 방법을 적용하여 최적의 한국인 자살 예측 모델을 개발하였다. 방법: 본 연구에서는 2017년, 2019년, 2021년의 한국 국민건강영양조사 자료를 통합하여 분석하고, 만 19세 이상 대상자의 자살 사고를 예측하고자 하였다. 로지스틱 회귀, 랜덤 포레스트(RF), k-최근접 이웃, 그래디언트 부스팅, 적응적 부스팅을 ML 알고리즘으로 사용하였다. 언더샘플링과 오버샘플링은 자료 불균형 문제를 해결하기 위한 리샘플링 방법으로 사용되었다. 결과: 연구 참여자 중 16,947명(95.14%)과 866명(4.86%)이 각각 대조군과 자살 사고군에 해당하였다. 15개 ML 모델 중, 언더샘플링 데이터를 사용해 학습된 알고리즘에서 RF 모델이 우수한 성능을 보였다(민감도=0.781, 곡선하 면적=0.870). 결론: 본 연구에서 개발한 ML 모델을 기반으로 추가적인 검증을 통해 최적화된 한국인 자살 예측 모델을 구축하는 것은 개인, 사회, 환경 요인의 상호작용으로 인해 발생하는 자살 위험 요인을 예측하는 데 도움이 될 것이다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.