고도로 현실적인 딥페이크 비디오의 확산은 대중의 신뢰와 디지털 정보의 무결성을 위협한다. 그러나 정교한 딥페이크를 탐지하려면 표면 수준의 시각적 인공물에 대한 분석을 넘어서는 접근이 필요하다. 본 연구는 생리적 근육 역학과 전체적인 의미 맥락을 적응적 주의(attention) 메커니즘을 통해 통합하여, 행동 단위(Action Unit)를 시간-문맥적 임베딩과 조화시키는 Harmonizing Action Units with Temporal-contextual Embeddings(HAUTE)를 제안한다. HAUTE는 시간에 따른 Action Unit의 조정(coordination) 패턴과 고수준 맥락 임베딩을 포착함으로써, 단일 양식에 의존한 분석에서는 지각하기 어려운 합성(synthesis)으로 인한 불일치를 모델이 드러낼 수 있도록 한다. 광범위한 실험을 통해 최신 성능을 확인하였으며, 특히 상용 도구 기반의 고품질 딥페이크에서 강한 교차 데이터셋 적응성을 보였다. 이는 웹 생태계에서 신뢰할 수 있는 콘텐츠 검증을 진전시킨다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.