대체 스플라이싱(AS) 사건은 특정 경로와 암에서의 표현형 가소성을 조절한다. 선행 연구에서 스플라이싱 사건을 계산적으로 분석한 바 있음에도 불구하고, 수많은 후보로부터 신뢰할 수 있는 AS 사건이 유도하는 생물학적 기능을 밝히는 일은 여전히 도전적이다. 경로 조절을 평가하기 위한 필수 스플라이싱 사건 시그니처를 제공하기 위하여, 우리는 두 가지 데이터셋을 수집하여 데이터베이스를 개발하였다: (i) 보고된 문헌 및 (ii) 암 전사체 프로파일. 전자는 자연어 처리 기법을 사용하여 63,229개의 PubMed 초록에서 수집된 지식 기반 스플라이싱 시그니처를 포함하며, 202개 경로에 대해 추출되었다. 후자는 16개 암 유형 및 42개 경로에 대한 팬-암 전사체에서 기계 학습 기반으로 식별된 스플라이싱 시그니처이다. 우리는 스플라이싱 프로파일로부터 경로의 활동성을 분류하기 위한 학습 데이터셋으로서 여섯 가지 서로 다른 학습 모델을 구축하였다. 각 경로에 대한 시그니처는 학습 모델의 특징 중요도(feature importance)로 상위에 랭크된 AS 사건을 사용하여 결정하였다. 학습 결과를 검증하기 위해 (i) 성능 지표, (ii) 외부 데이터셋으로부터 획득한 차등 AS 세트, (iii) 우리의 지식 기반 시그니처의 세 가지 방식으로 평가를 수행하였다. 학습 모델의 수신자 조작 특성(receiver operating characteristic) 곡선 아래 면적 값은 뚜렷한 급격한 차이를 보이지 않았다. 그러나 랜덤 포레스트는 외부 데이터셋에서 확인된 AS 세트 및 지식 기반 시그니처와 비교했을 때 현저하게 최고의 성능을 나타냈다. 따라서 우리는 랜덤 포레스트 모델로부터 얻은 시그니처를 사용하였다. 우리의 데이터베이스는 생존 분석, 분자 아형, 종양 미세환경을 포함하여 AS 시그니처의 임상적 특성을 제공하였다. 또한 스플라이싱 인자에 의한 조절을 추가로 조사하였다. 개발된 시그니처에 대한 우리의 데이터베이스는 검색 및 시각화 시스템을 지원한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.