본 과제는 유전자·영상·금융·네트워크처럼 데이터가 서로 연관된 상황에서 여러 가설을 동시에 검정해도 오류율을 적절히 조절하는 다중검정 통계 방법론을 개발하는 연구임.
연구목표는 강한 가설 간 연관성을 반영하면서 FDR 제어를 수행하고, 기존의 정규성 같은 분포 가정을 data-adaptive(비모수)로 추정하는 데 있음. 핵심 연구내용은 Markov chain, 2차원 lattice(Ising), 비정형 graph(tree 기반)에서 전이확률·분포추정과 다중검정 절차를 유기적으로 통합하거나 계산 알고리즘을 일반화하는 방법 제안임. 기대효과는 모수적 가정 완화와 1차원→2차원→비정형 구조 확장으로 robust하고 활용 범위가 넓은 다중검정 결과 도출임.
본 과제는 여러 가설을 동시에 검정할 때, 가설들 사이의 연관성이 강한 고차원 자료에서 FDR을 효율적으로 조절하는 통계방법론을 연구하는 프로젝트임.
연구 목표는 hidden Markov random field (HMRF) 기반으로 Markov chain(1차원), 이차원 lattice(Ising model), 비정형 graph(tree 구조)로 다중검정을 확장하고, 분포의 정규성 가정을 비모수적으로 추정해 data-adaptive 절차를 구현하는 데 있음. 기대 효과는 모수적 강한 가정을 완화하면서 robust한 다중검정이 가능해 fMRI, 유전자, SNS network 등 다양한 자료 분석에 활용성 확대됨.
본 과제는 유전자·영상·금융 등에서 여러 가설을 동시에 검정할 때, 가설들 사이의 연관성을 반영해 더 정확한 결과를 얻는 통계방법을 개발하는 연구임.
연구 목표는 다중검정에서 false discovery rate (FDR)을 FDR 이하로 조절하면서, 가정되던 독립성과 정규성 같은 강한 분포 가정을 완화하고 hidden Markov random field (HMRF) 기반 및 data-adaptive 추정을 구현하는 데 있음. 핵심 내용은 Markov chain, 이차원 lattice(Ising model), 비정형 graph(tree)로 구조를 1차원→2차원→비정형으로 확장하며 전이확률 추정·준모수적 분포 추정과 다중검정 절차를 통합하는 알고리즘 개발임. 기대 효과는 robust하고 활용 범위가 넓은 다중검정 절차 제공으로 fMRI·SNS network 등 고차원 자료 분석 성능 향상임.
1차년도: 일반 회귀 모형에서의 변수선택을 중점적으로 연구할 계획이다. 변수선택이란 반응변수에 영향을 미치는 여러 개의 설명변수들 중에서 유의하게 연관된 설명변수들을 골라내는 것으로 통계학에서 매우 중요한 역할을 한다. 과학기술의 발달과 측정 기기의 발달 및 자료의 전산화 등으로 인해 데이터의 양과 종류가 폭증하면서 변수선택은 더욱 각광받게 되었다. 특히 샘플사이즈보다 변수의 개수가 많아지는 High dimension Low Sample Size 문제들은 변수선택에 대한 연구를 더욱 가속화 하였다. 일반적으로 베이지안 변수 선택에 있어서는 Stochastic Search Variable Selection이 골조를 이룬다. 모형 A의 핵심 아이디어는 각 변수의 포함여부를 나타내는 잠재변수 의 사용에 있다. 각 j번째 설명변수 에 대응되는 잠재변수 가 1의 값을 가질 때는 설명변수 의 회귀계수의 추정값이 0으로부터 먼 값을 가질 수 있도록 허용하고, 가 0의 값을 가질 때는 명변수 의 회귀계수의 추정값이 0근처에 머물도록 제한한다. 본 연구에서는 설명변수간에 상관성(dependency)이나 위계제약 (heredity constraint)이 있는 경우에 효과적으로 모수공간을 탐색할 수 있는 알고리즘을 개발하고자 한다.
2차년도: 1차년도에 일반회귀모형을 바탕으로 개발된 알고리즘을 로지스틱 회귀모형과 생존자료 모형으로 확장하고자 한다.
3차년도: 베이지안 변수선택에서의 잠재변수 의 사용은 회귀모형에서의 변수선택 문제를 Hidden Markov Random Field (HMRF)에서의 다중검정(multiple testing)로 쉽게 확장할 수 있다 해당연도에는 인접 자료간에 의존성이 존재하는 1차원 two-state HMRF상에서의 베이지안 다중검정을 연구하고자 한다. 특히 correlation이 존재하는 고차원 HMRF에서의 효과적 MCMC알고리즘 개발에 중점을 둔다. 이후 2차원 twp-state HMRF로 확장한 연구를 진행한다.
1차년도: 일반 회귀 모형에서의 변수선택을 중점적으로 연구할 계획이다. 변수선택이란 반응변수에 영향을 미치는 여러 개의 설명변수들 중에서 유의하게 연관된 설명변수들을 골라내는 것으로 통계학에서 매우 중요한 역할을 한다. 과학기술의 발달과 측정 기기의 발달 및 자료의 전산화 등으로 인해 데이터의 양과 종류가 폭증하면서 변수선택은 더욱 각광받게 되었다. 특히 샘플사이즈보다 변수의 개수가 많아지는 High dimension Low Sample Size 문제들은 변수선택에 대한 연구를 더욱 가속화 하였다. 일반적으로 베이지안 변수 선택에 있어서는 Stochastic Search Variable Selection이 골조를 이룬다. 모형 A의 핵심 아이디어는 각 변수의 포함여부를 나타내는 잠재변수 의 사용에 있다. 각 j번째 설명변수 에 대응되는 잠재변수 가 1의 값을 가질 때는 설명변수 의 회귀계수의 추정값이 0으로부터 먼 값을 가질 수 있도록 허용하고, 가 0의 값을 가질 때는 명변수 의 회귀계수의 추정값이 0근처에 머물도록 제한한다. 본 연구에서는 설명변수간에 상관성(dependency)이나 위계제약 (heredity constraint)이 있는 경우에 효과적으로 모수공간을 탐색할 수 있는 알고리즘을 개발하고자 한다.
2차년도: 1차년도에 일반회귀모형을 바탕으로 개발된 알고리즘을 로지스틱 회귀모형과 생존자료 모형으로 확장하고자 한다.
3차년도: 베이지안 변수선택에서의 잠재변수 의 사용은 회귀모형에서의 변수선택 문제를 Hidden Markov Random Field (HMRF)에서의 다중검정(multiple testing)로 쉽게 확장할 수 있다 해당연도에는 인접 자료간에 의존성이 존재하는 1차원 two-state HMRF상에서의 베이지안 다중검정을 연구하고자 한다. 특히 correlation이 존재하는 고차원 HMRF에서의 효과적 MCMC알고리즘 개발에 중점을 둔다. 이후 2차원 twp-state HMRF로 확장한 연구를 진행한다.