배경: 태아 알코올 증후군(Fetal alcohol syndrome, FAS)은 임신 중 알코올 노출(prenatal alcohol exposure, PAE)과 관련하여 발생하는 평생 지속되는 발달 장애이다. 예측 모델이 개선됨에 따라, FAS는 완전히 예방되지는 않더라도 조기에 진단하거나 치료할 수 있다. 목적: 본 연구에서는 임신 중 음주를 한 여성들을 대상으로 FAS 예측 성능과 관련하여 서로 다른 기계 학습 알고리즘을 비교하고자 하였다. 또한 정확한 모델을 생성하는 데 가장 영향력 있는 변수가 무엇인지(예: 임신 중 알코올 노출 시기, 섭취한 알코올의 종류) 확인하고자 하였다. 방법: 2007년부터 2017년까지의 태아 알코올 스펙트럼 장애에 관한 공동 이니셔티브 자료를 사용하여, 미국 내 5개 병원 현장에서 임신 중 알코올을 섭취한 595명의 여성에 대한 정보를 수집하였다. PAE에 관한 정보를 얻기 위해 설문지 또는 대면 인터뷰뿐 아니라 의학적·법적·사회서비스 기록의 검토를 통해 알코올 섭취에 관한 정보를 수집하였다. 출생 시 FAS의 유병률을 예측하기 위해 4가지 기계 학습 알고리즘(로지스틱 회귀, XGBoost, light gradient-boosting machine, CatBoost)을 훈련하였고, 모델 성능은 수신자 조작 특성 곡선(receiver operating characteristics, ROC) 아래 면적(area under the receiver operating characteristics curve, AUROC)을 분석하여 측정하였다. 전체 사례 중 80%는 무작위로 훈련에 사용하였고, 나머지 20%는 FAS 예측을 위한 테스트 데이터셋으로 유지하였다. 또한 성능이 가장 우수한 알고리즘에 대해서는 Shapley 값을 이용하여 변수 중요도를 분석하였다. 결과: 전체 595명의 PAE 대상자 중 FAS 사례는 20건이었다. 대부분의 음주는 1분기에서만 발생했는데(n=491) 또는 3분기 전체에서 나타났으며(n=95), 다만 1분기와 2분기에만 음주가 있었다는 보고(n=8)와 3분기에만 음주가 있었던 1건도 있었다. CatBoost 방법은 AUROC(0.92) 및 정밀도-재현율 곡선(precision-recall curve) 아래 면적(AUPRC 0.51) 측면에서 가장 우수한 성능을 보였고, 이어서 로지스틱 회귀( AUROC 0.90; AUPRC 0.59), light gradient-boosting machine(AUROC 0.89; AUPRC 0.52), XGBoost(AUROC 0.86; AURPC 0.45) 순이었다. CatBoost 모델에서의 Shapley 값은 FAS 예측에서 12개 변수가 중요하게 고려되었음을 보여주었으며, 임신 3분기 전체에 걸친 음주, 산모의 연령, 인종, 섭취한 알코올 음료의 종류(예: 맥주, 와인 또는 주류)가 전반적 변수 중요도에서 높은 점수를 받았다. 대부분의 예측 지표에서 최상의 성능은 CatBoost 알고리즘에서 얻어졌고, AUROC 0.92, 정밀도 0.50, 특이도 0.29, F1 점수 0.29, 정확도 0.96이었다. 결론: 기계 학습 알고리즘은 임신 중 음주자에서 FAS 위험을 이전 모델들보다 더 높은 예측 성능으로 식별할 수 있었다. FAS에서 흔히 나타나는 소규모 훈련 집합의 경우, CatBoost와 같은 부스팅 메커니즘은 데이터 불균형과 최적화 또는 일반화의 어려움과 관련된 특정 문제를 완화하는 데 도움이 될 수 있다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.