목적: 수면무호흡증은 심각한 건강 문제를 수반하는 흔한 수면 장애이다. 본 연구는 PSG-Audio 데이터를 사용하여 수면무호흡증 아형을 비침습적으로 검출하기 위한 Transformer 기반 오디오 분할 모델인 ApneaWhisper를 소개한다. 환자 및 방법: 우리는 284명의 환자에서 수집된 PSG-Audio 데이터셋을 활용하였다. ApneaWhisper는 사전학습된 Whisper 인코더를 활용하여 20초 길이의 오디오 클립에서 10 ms 해상도의 프레임 수준 특징을 추출한다. 토큰 기반 분할과 분류 헤드를 갖춘 경량 Transformer 디코더가 이 특징들을 집계하여 프레임 수준 및 클립 수준 예측을 모두 수행한다. 데이터 불균형을 완화하기 위해, 무호흡 아형 간 클래스 불균형을 고려한 가중 교차 엔트로피 손실을 사용하여 모델을 미세조정하였다. 결과: ApneaWhisper는 수면무호흡증 검출에서 강한 성능을 보였으며, 클립 수준 F1-score는 0.82, 프레임 수준 F1-score는 0.70로 MFCC+DNN, VGGish+bi-LSTM, VAD 기반 모델을 포함한 기존 기준 모델을 능가하였다. 또한 OSA, MSA, CSA 및 저호흡을 구분하는 데에도 유망한 능력을 보였으나, 성공 정도는 아형에 따라 다르게 나타났다. 결론: 모델의 세밀한 시간 해상도는 무호흡 사건의 정밀한 위치 추정, 지속시간 산정, 아형 분류를 가능하게 한다. ApneaWhisper는 OSA에 대해 견고한 성능을 보이는 반면, 중심성(CSA) 및 혼합성(MSA) 수면무호흡을 구분하는 데에는 어려움이 남아 있는데, 이는 미묘하거나 모호한 음향 패턴에 기인한다. 프레임 수준 분할은 또한 정확한 무호흡-저호흡지수(AHI) 추정을 가능하게 하여, 일부 임상 및 가정 모니터링 시나리오에서 전체 PSG 의존도를 낮출 수 있을 것으로 기대된다. 향후 개선은 다중모달 통합(예: 산소포화도)과 소음에 강인한 학습 기법을 포함할 수 있다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.