주요 논문
5
*2026년 기준 최근 6년 이내 논문에 한해 Impact Factor가 표기됩니다.
1
Article
|
인용수 0
·
2025SPARCC: Semi-Parametric Robust Estimation in a Right-Censored Covariate Model
Seong-ho Lee, Brian Richardson, Yanyuan Ma, Karen Marder, Tanya P. Garcia
IF 3 (2025)
Journal of the American Statistical Association
헌팅턴병 연구에서 현재의 목표는 임상 진단 이전에 증상이 어떻게 변화하는지 이해하는 것이다. 통계적으로 이 목표를 달성하려면 증상 중증도를 공변량 '진단 시점(time of diagnosis)'의 함수로 모형화해야 하며, 이는 관찰 연구에서 흔히 강하게 우측 검열(right-censored)된다. 완전사례 추정량(complete case estimator)과 최대우도추정량(maximum likelihood estimator)과 같이 우측 검열 공변량을 처리하는 기존 추정량들은, (즉) 검열된 공변량과 검열 변수(censoring variable)에 대한 밀도(densities)인 비모수(nuisance) 모수의 모형 설정이 잘못되었을 때의 통계적 효율과 견고성에서 차이가 있다. 우리는 새
https://doi.org/10.1080/01621459.2025.2562645
Covariate
Estimation
Estimation theory
Robustness (evolution)
Robust statistics
2
Preprint
|
인용수 0
·
2024Robust and efficient estimation in the presence of a randomly censored covariate
Seong-ho Lee, Brian Richardson, Yanyuan Ma, Karen Marder, Tanya P. Garcia
arXiv (Cornell University)
헌팅턴병 연구에서 현재의 목표 중 하나는 임상 진단 이전에 증상이 어떻게 변화하는지를 이해하는 것이다. 통계적으로 이는 증상 중증도를 공변량인 ‘진단까지의 시간(time until diagnosis)’의 함수로 모형화하는 것을 포함하며, 이는 관찰 연구에서 종종 강한 우측 검열(right-censored)을 동반한다. 우측 검열된 공변량을 처리하는 기존 추정기들은 검열된 공변량 및 검열 변수(censoring variable)의 주변분포(nuisance distribution)에 대해 모형이 잘못 지정(misspecified)된 경우의 통계적 효율성과 견고성이 서로 다르다. 한 극단에는 완전 사례 추정(complete case estimation)이 있는데, 이는 검열되지 않은 자료만을 사용하므로 주변분포 모형의 영향을 받지 않지만 정보가 있는 검열 관측치를 버린다. 다른 극단에서는 최대우도추정(maximum likelihood estimation)이 최대의 효율성을 갖지만 공변량의 분포가 잘못 지정되면 일치성을 보장하지 못한다. 우리는 견고하고 효율적인 반모수적(semiparametric) 추정기를 제안한다. 주변분포가 모수적으로 모형화되는 경우, 이 추정기는 이중 견고성(doubly robust)을 가지는데, 즉 적어도 한 분포가 올바르게 지정되면 일치하며, 두 모형이 모두 올바르게 지정되면 반모수적 효율성을 갖는다. 주변분포가 비모수적 또는 머신러닝 방법으로 추정되는 경우, 이 추정기는 일치적이며 반모수적으로 효율적이다. 우리는 R 패키지 sparcc에 구현된 제안 추정기가 주장된 성질을 갖는다는 점을 경험적으로 보이고, Enroll-HD 연구 자료를 사용하여 헌팅턴병 증상 궤적(symptom trajectories)을 연구하는 데 이를 적용한다.
http://arxiv.org/abs/2409.07795
Covariate
Estimation
Statistics
Econometrics
Censoring (clinical trials)
Mathematics
Computer science
Economics
3
Article
|
인용수 1
·
2024Doubly Flexible Estimation under Label Shift
Seong-ho Lee, Yanyuan Ma, Jiwei Zhao
IF 3 (2024)
Journal of the American Statistical Association
. (b)를 추정하는 과정은 때때로 기성(off-the-shelf) 방식으로는 가능하나, 차원의 저주(curse of dimensionality) 또는 계산상의 어려움과 관련된 문제에 직면할 수 있다. 우리는 제안된 추정기에 대한 대표본 이론을 개발하고, 시뮬레이션 연구를 통해 유한표본 성능을 고찰함과 동시에 MIMIC-III 데이터베이스에 적용한다.
https://doi.org/10.1080/01621459.2024.2321653
Estimation
Statistics
Mathematics
Econometrics
Computer science
Economics
4
Article
|
인용수 0
·
2023Optimal Sampling for Positive Only Electronic Health Record Data
Seong-ho Lee, Yanyuan Ma, Ying Wei, Jinbo Chen
IF 1.4 (2023)
Biometrics
전자 의무기록(EMR)로부터 환자의 질병/건강 상태를 식별하는 일은 전자건강기록(EHR) 관련 연구에서 자주 마주치는 과제이며, 분류 모델의 추정(학습)에는 환자의 알려진 표현형(phenotype) 상태에 대한 벤치마크 학습 데이터가 종종 필요하다. 그러나 표현형의 평가는 비용이 많이 들고 노동 집약적이므로, 학습 집합으로 사용할 EHR 기록을 적절히 선택하는 것이 바람직하다. 본 연구는 분류 모델에 대해 표본 크기가 제한된 상황에서, 평균제곱 표현형/분류 오차(MSE)를 최소화하는 최선의 학습 부분표본을 맞춤형으로 선택하는 절차를 제안한다. 우리의 접근은 이용 가능할 때, 거짓 경보(false alarm) 없이 질병 상태의 진정한 상태를 근사하는 정보인 “양성만(positive only)” 정보를 포함한다. 또한 본 표집 절차는 잘못 지정(misspecified)될 수 있는, 임의로 선택한 분류 모델의 학습에도 적용 가능하다. MSE 관점에서의 최적성에 대해 이론적 정당화를 제공한다. 제안 방법의 성능 향상은 모의실험과 실제 데이터 예시를 통해 설명되며, MSE를 넘어서는 기준에서도 종종 만족스러운 것으로 나타난다.
https://doi.org/10.1111/biom.13824
Benchmark (surveying)
Computer science
Health records
Sampling (signal processing)
Mean squared error
Sample size determination
Medical record
Machine learning
Task (project management)
Set (abstract data type)
5
Article
|
인용수 0
·
2023Semiparametric approach to estimation of marginal mean effects and marginal quantile effects
Seong-ho Lee, Yanyuan Ma, Elvezio Ronchetti
IF 9.9 (2023)
Journal of Econometrics
https://doi.org/10.1016/j.jeconom.2023.05.002
Quantile
Estimator
Econometrics
Mathematics
Asymptotic distribution
Consistency (knowledge bases)
Marginal model
Semiparametric model
Marginal distribution
Semiparametric regression