프로젝트 소개
본 과제는 인간 유전체의 비암호화 DNA 영역을 ‘언어’처럼 보고, 염기서열만으로 후성유전학적 특성을 모델링하는 연구임.
연구 목표는 ENCODE의 Chromatin State 기반 정보를 단서로 삼되 실험 데이터 없이 염기서열로 언어학적 모델을 구축하는 데 있음. 연구 내용은 200-bp 블록 경계를 재확정해 n-그램 코퍼스를 재구축하고, 자동 언어문법취득 및 classification·에러분석으로 마코프 체인 특성이 약한 영역을 재분석함. 또한 장거리 의존성 탐색과 다양한 기계학습으로 type2·type1 문법 모델을 만들며, SNP 등 광범위 데이터를 통합해 Statistical CFG 또는 feature-based CFG와 피쳐 애노테이션 데이터베이스를 구축함. 기대 효과는 염기서열에 직접 태깅된 코퍼스가 후속 학습용 데이터로 활용됨과 동시에, 전체게놈 문법 및 진화 패턴 규칙 규명으로 확장 가능함.