임상 의학에서 정책 연구에 이르기까지 다양한 연구에서, 완전한 데이터는 보통 모집단 \mathscr{P}로부터 이용 가능하지만, 관심의 양은 대개 관련되지만 다른 모집단 \mathscr{Q}에 대해 구하고자 하며, \mathscr{Q}는 부분 데이터만을 가진다. 본 논문에서는, 결과변수 Y와 공변량 모두가 \mathscr{P}에서 관측 가능하고 \mathscr{Q}에서는 만 관측 가능하다는 설정을 고려한다. 이는 이른바 label shift 가정, 즉 두 모집단 간에 Y가 주어졌을 때의 의 조건분포가 동일하다는 가정에 해당한다. \mathscr{P}로부터의 정보를 활용하여 \mathscr{Q}에서 관심 파라미터를 추정하기 위해서는 다음 세 가지 요소가 필수적이다: (a) Y가 주어졌을 때 의 공통 조건분포, (b) \mathscr{P}에서 가 주어졌을 때의 Y에 대한 회귀모형, 그리고 (c) 두 모집단 사이에서 Y의 밀도비(density ratio). 우리는 조건부기대의 근사를 (a)에 대해 수행하기 위해 표준 비모수 기법만을 필요로 하는 추정 절차를 제안하며, (b)나 (c)에 대해서는 어떠한 추정이나 모형화도 필요하지 않다. 즉, (b)와 (c) 모두에 대한 가능한 모형 불일치(model misspecification)에 대해 이중 유연성(doubly flexible)을 가진다. 이는 잘 알려진 이중견고(doubly robust) 추정과 개념적으로 다르다. 이중견고에서는 최대 하나의 모형만이 불일치해도 되지만, 본 제안은 (b)와 (c) 모두가 불일치하도록 허용할 수 있다. 이는 특히 \mathscr{Q}에서 Y 데이터가 부재하다는 점 때문에 (c)의 추정이 어렵거나 불가능할 수 있는 우리의 설정에서 더욱 중요하다. 또한 (b)의 추정이 때때로 기성 도구로 간단히 수행될 수는 있지만, 차원에 따른 저주(curse of dimensionality) 또는 계산상의 어려움에 직면할 수 있다. 우리는 제안된 추정량에 대한 대표본 이론을 개발하고, 시뮬레이션 연구를 통해 그 유한표본 성능을 평가하는 한편, MIMIC-III 데이터베이스에의 적용을 수행한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.