후성유전체학 데이터를 활용한 인간유전체 비암호화 영역에 대한 언어학적인 모델링

2020과학기술정보통신부개인기초연구(과기정통부)(R&D)
프로젝트 소개
본 과제는 인간 유전체의 비암호화 DNA 영역을 ‘언어’처럼 보고, 염기서열만으로 후성유전학적 특성을 모델링하는 연구임. 연구 목표는 ENCODE의 Chromatin State 기반 정보를 단서로 삼되 실험 데이터 없이 염기서열로 언어학적 모델을 구축하는 데 있음. 연구 내용은 200-bp 블록 경계를 재확정해 n-그램 코퍼스를 재구축하고, 자동 언어문법취득 및 classification·에러분석으로 마코프 체인 특성이 약한 영역을 재분석함. 또한 장거리 의존성 탐색과 다양한 기계학습으로 type2·type1 문법 모델을 만들며, SNP 등 광범위 데이터를 통합해 Statistical CFG 또는 feature-based CFG와 피쳐 애노테이션 데이터베이스를 구축함. 기대 효과는 염기서열에 직접 태깅된 코퍼스가 후속 학습용 데이터로 활용됨과 동시에, 전체게놈 문법 및 진화 패턴 규칙 규명으로 확장 가능함.
후성유전체학게놈데이터언어학적인 모델링epigeneticsgenomelinguistic modelling
참여형태
주관
사업명
개인기초연구(과기정통부)(R&D)
부처명
과학기술정보통신부
주관기관명
이화여자대학교
과제 수행연도
2020
과제 수행기간
2019.06.01 ~ 2021.02.28
과제 고유번호
1711114471
연구 개발단계
기초연구
연구비
총연구비
50,000,000
정부지원연구개발비
50,000,000
위탁연구비
0
민간연구비
0
주관/협동기관 정보
주관/협동수행기관명연구수행주체지역
주관이화여자대학교대학서울특별시
과제 기반 국내외 특허0건
출원/등록 기관발명의 명칭출원일자출원국가출원번호등록일자등록번호
과제 기반 SCI(E) 논문0건
논문명학술지명DOI/URL