딥페이크 식별을 위한 딥페이크 식별 모델의 학습 방법 및 시스템
Method for learning a deepfake identification model to identify deepfakes and system thereof
특허 요약
본 발명은 딥페이크 식별을 위한 딥페이크 식별 모델의 학습 기술에 관한 것으로, 딥페이크 탐지 학습 장치는 하나 이상의 얼굴 이미지를 포함하는 텍스트 프롬프트 이미지 데이터셋을 입력 받고, 텍스트 프롬프트 이미지 데이터셋을 기반으로 반복적 접근 방식(iterative approach)을 통해 사람 얼굴 이미지만을 포함하고 있는 제1 데이터셋 및 제2 데이터셋을 생성하고, 하나 이상의 얼굴 이미지만을 포함하는 복수 개의 이미지 데이터셋을 입력 받고, 제1 데이터셋, 제2 데이터셋 및 복수 개의 이미지 데이터셋을 딥페이크 식별 모델에 훈련 데이터로서 입력하고, 제1 데이터셋, 제2 데이터셋 및 복수 개의 이미지 데이터셋의 정보 및 딥페이크 식별 모델의 정보를 기반으로, 딥페이크 이미지를 탐지하기 위한 모멘텀 부스팅(Momentum Boosting) 기법을 딥페이크 식별 모델에 적용할 수 있다.
청구항
번호청구항
1

딥페이크 식별 모델을 위한 딥페이크 탐지 학습 방법에 있어서,딥페이크 탐지 학습 장치가 하나 이상의 얼굴 이미지를 포함하는 텍스트 프롬프트 이미지 데이터셋을 입력 받는 단계;상기 딥페이크 탐지 학습 장치가 상기 텍스트 프롬프트 이미지 데이터셋을 기반으로 반복적 접근 방식(iterative approach)을 통해 사람 얼굴 이미지만을 포함하고 있는 제1 데이터셋 및 제2 데이터셋을 생성하는 단계;상기 딥페이크 탐지 학습 장치가 하나 이상의 얼굴 이미지만을 포함하는 복수 개의 이미지 데이터셋을 입력 받고, 상기 제1 데이터셋, 상기 제2 데이터셋 및 상기 복수 개의 이미지 데이터셋을 상기 딥페이크 식별 모델에 훈련 데이터로서 입력하는 단계; 및상기 딥페이크 탐지 학습 장치가 상기 제1 데이터셋, 상기 제2 데이터셋 및 상기 복수 개의 이미지 데이터셋의 정보 및 상기 딥페이크 식별 모델의 정보를 기반으로, 딥페이크 이미지를 탐지하기 위한 모멘텀 부스팅(Momentum Boosting) 기법을 상기 딥페이크 식별 모델에 적용하는 단계;를 포함하는 딥페이크 탐지 학습 방법.

2

제1 항에 있어서,상기 제1 데이터셋 및 제2 데이터셋을 생성하는 단계는,상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 대형 언어 모델(large language model)을 통해 미리 정의된 범주로 얼굴 이미지를 분류하는 제로샷 분류(zero-shot classification)를 수행하는 단계;상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 얼굴 인식 모델을 통해 사람 얼굴이 포함된 이미지만을 선택적으로 유지하는 단계; 및미리 설정된 색상 임계 값을 기준으로 상기 텍스트 프롬프트 이미지 데이터셋 내 각각의 이미지의 색상 변화(color variance)를 측정하고, 미리 설정된 가장자리 임계 값을 기준으로 가장자리 감지 모델을 통해 상기 텍스트 프롬프트 이미지 데이터셋 내 각각의 이미지의 가장자리 수를 측정함으로써, 사람 얼굴 이미지만을 포함하고 있는 상기 제1 데이터셋을 생성하는 단계;를 포함하는 딥페이크 탐지 학습 방법.

3

제1 항에 있어서,상기 제1 데이터셋 및 제2 데이터셋을 생성하는 단계는,상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 대형 언어 모델(large language model)을 통해 미리 정의된 범주로 얼굴 이미지를 분류하는 제로샷 분류(zero-shot classification)를 수행하는 단계;상기 텍스트 프롬프트 이미지 데이터셋 내 하나 이상의 스타일 텍스트 프롬프트 이미지를 대상으로 비현실적 스타일 텍스트 프롬프트를 포함하는 이미지를 제거하는 단계; 및상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 얼굴 인식 모델을 통해 사람 얼굴이 포함된 이미지만을 선택적으로 유지함으로써 사람 얼굴 이미지만을 포함하고 있는 상기 제2 데이터셋을 생성하는 단계;를 포함하는 딥페이크 탐지 학습 방법.

4

제1 항에 있어서,상기 모멘텀 부스팅 기법을 상기 딥페이크 식별 모델에 적용하는 단계는,상기 제1 데이터셋, 상기 제2 데이터셋 및 상기 복수 개의 이미지 데이터셋을 결합하여 결합 데이터셋을 생성하고, 상기 결합 데이터셋의 정보를 추출하는 단계;상기 결합 데이터셋 내 임의의 얼굴 이미지에 대한 가중치 정보를 추출하는 단계; 및상기 결합 데이터셋의 정보, 상기 임의의 얼굴 이미지에 대한 가중치 정보 및 상기 딥페이크 식별 모델의 손실 함수 정보를 기반으로, 상기 임의의 얼굴 이미지의 순간적인 인스턴스에 부여된 난이도 정보를 정량화하는 상기 모멘텀 부스팅 기법을 상기 딥페이크 식별 모델에 적용하는 단계;를 포함하는 딥페이크 탐지 학습 방법.

5

제4 항에 있어서,상기 결합 데이터셋 내 임의의 얼굴 이미지에 대한 가중치 정보를 추출하는 단계는,상기 딥페이크 식별 모델의 모멘텀 이동 평균 정보를 기반으로 상기 딥페이크 식별 모델의 예측 값 및 상기 임의의 얼굴 이미지에 대한 실측(Ground Truths) 값 사이의 교차 엔트로피 정보를 측정함으로써, 상기 임의의 얼굴 이미지에 대한 가중치 정보를 추출하는 딥페이크 탐지 학습 방법.

6

제1 항 내지 제5 항 중에 어느 한 항의 방법을 컴퓨터에서 실행시키기 위 한 프로그램을 기록한 컴퓨터로 읽을 수 있는 기록매체.

7

딥페이크 식별 모델을 위한 딥페이크 탐지 학습 장치에 있어서,프로세서(processor); 및상기 프로세서에 의해 수행되는 하나 이상의 명령이 저장된 메모리(memory)를 포함하고,상기 하나 이상의 명령은,하나 이상의 얼굴 이미지를 포함하는 텍스트 프롬프트 이미지 데이터셋을 입력 받는 단계;상기 텍스트 프롬프트 이미지 데이터셋을 기반으로 반복적 접근 방식(iterative approach)을 통해 사람 얼굴 이미지만을 포함하고 있는 제1 데이터셋 및 제2 데이터셋을 생성하는 단계;하나 이상의 얼굴 이미지만을 포함하는 복수 개의 이미지 데이터셋을 입력 받고, 상기 제1 데이터셋, 상기 제2 데이터셋 및 상기 복수 개의 이미지 데이터셋을 상기 딥페이크 식별 모델에 훈련 데이터로서 입력하는 단계; 및상기 제1 데이터셋, 상기 제2 데이터셋 및 상기 복수 개의 이미지 데이터셋의 정보 및 상기 딥페이크 식별 모델의 정보를 기반으로, 딥페이크 이미지를 탐지하기 위한 모멘텀 부스팅(Momentum Boosting) 기법을 상기 딥페이크 식별 모델에 적용하는 단계;를 포함하는 딥페이크 탐지 학습 장치.

8

제7 항에 있어서,상기 제1 데이터셋 및 제2 데이터셋을 생성하는 단계는,상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 대형 언어 모델(large language model)을 통해 미리 정의된 범주로 얼굴 이미지를 분류하는 제로샷 분류(zero-shot classification)를 수행하는 단계;상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 얼굴 인식 모델을 통해 사람 얼굴이 포함된 이미지만을 선택적으로 유지하는 단계; 및미리 설정된 색상 임계 값을 기준으로 상기 텍스트 프롬프트 이미지 데이터셋 내 각각의 이미지의 색상 변화(color variance)를 측정하고, 미리 설정된 가장자리 임계 값을 기준으로 가장자리 감지 모델을 통해 상기 텍스트 프롬프트 이미지 데이터셋 내 각각의 이미지의 가장자리 수를 측정함으로써, 사람 얼굴 이미지만을 포함하고 있는 상기 제1 데이터셋을 생성하는 단계;를 포함하는 딥페이크 탐지 학습 장치.

9

제7 항에 있어서,상기 제1 데이터셋 및 제2 데이터셋을 생성하는 단계는,상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 대형 언어 모델(large language model)을 통해 미리 정의된 범주로 얼굴 이미지를 분류하는 제로샷 분류(zero-shot classification)를 수행하는 단계;상기 텍스트 프롬프트 이미지 데이터셋 내 하나 이상의 스타일 텍스트 프롬프트 이미지를 대상으로 비현실적 스타일 텍스트 프롬프트를 포함하는 이미지를 제거하는 단계; 및상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 얼굴 인식 모델을 통해 사람 얼굴이 포함된 이미지만을 선택적으로 유지함으로써 사람 얼굴 이미지만을 포함하고 있는 상기 제2 데이터셋을 생성하는 단계;를 포함하는 딥페이크 탐지 학습 장치.

10

제7 항에 있어서,상기 모멘텀 부스팅 기법을 상기 딥페이크 식별 모델에 적용하는 단계는,상기 제1 데이터셋, 상기 제2 데이터셋 및 상기 복수 개의 이미지 데이터셋을 결합하여 결합 데이터셋을 생성하고, 상기 결합 데이터셋의 정보를 추출하는 단계;상기 결합 데이터셋 내 임의의 얼굴 이미지에 대한 가중치 정보를 추출하는 단계; 및상기 결합 데이터셋의 정보, 상기 임의의 얼굴 이미지에 대한 가중치 정보 및 상기 딥페이크 식별 모델의 손실 함수 정보를 기반으로, 상기 임의의 얼굴 이미지의 순간적인 인스턴스에 부여된 난이도 정보를 정량화하는 상기 모멘텀 부스팅 기법을 상기 딥페이크 식별 모델에 적용하는 단계;를 포함하는 딥페이크 탐지 학습 장치.

11

제10 항에 있어서,상기 결합 데이터셋 내 임의의 얼굴 이미지에 대한 가중치 정보를 추출하는 단계는,상기 딥페이크 식별 모델의 모멘텀 이동 평균 정보를 기반으로 상기 딥페이크 식별 모델의 예측 값 및 상기 임의의 얼굴 이미지에 대한 실측(Ground Truths) 값 사이의 교차 엔트로피 정보를 측정함으로써, 상기 임의의 얼굴 이미지에 대한 가중치 정보를 추출하는 딥페이크 탐지 학습 장치.

12

텍스트 프롬프트 이미지 데이터셋을 포함하는 복수 개의 이미지 데이터셋을 획득하는 이미지 데이터셋 획득 장치; 및상기 이미지 데이터셋 획득 장치로부터 상기 복수 개의 이미지 데이터셋을 입력 받아 딥페이크 식별 모델을 위한 모멘텀 부스팅(Momentum Boosting) 기법을 상기 딥페이크 식별 모델에 적용하는 딥페이크 탐지 학습 장치를 포함하고,상기 딥페이크 탐지 학습 장치는,하나 이상의 얼굴 이미지를 포함하는 상기 텍스트 프롬프트 이미지 데이터셋을 입력 받고, 상기 텍스트 프롬프트 이미지 데이터셋을 기반으로 반복적 접근 방식(iterative approach)을 통해 사람 얼굴 이미지만을 포함하고 있는 제1 데이터셋 및 제2 데이터셋을 생성하고, 하나 이상의 얼굴 이미지만을 포함하는 복수 개의 이미지 데이터셋을 입력 받고, 상기 제1 데이터셋, 상기 제2 데이터셋 및 상기 복수 개의 이미지 데이터셋을 상기 딥페이크 식별 모델에 훈련 데이터로서 입력하고, 상기 제1 데이터셋, 상기 제2 데이터셋 및 상기 복수 개의 이미지 데이터셋의 정보 및 상기 딥페이크 식별 모델의 정보를 기반으로, 딥페이크 이미지를 탐지하기 위한 모멘텀 부스팅(Momentum Boosting) 기법을 상기 딥페이크 식별 모델에 적용하는 딥페이크 탐지 학습 시스템.

13

제12 항에 있어서,상기 제1 데이터셋 및 제2 데이터셋을 생성하는 경우,상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 대형 언어 모델(large language model)을 통해 미리 정의된 범주로 얼굴 이미지를 분류하는 제로샷 분류(zero-shot classification)를 수행하고, 상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 얼굴 인식 모델을 통해 사람 얼굴이 포함된 이미지만을 선택적으로 유지하고, 미리 설정된 색상 임계 값을 기준으로 상기 텍스트 프롬프트 이미지 데이터셋 내 각각의 이미지의 색상 변화(color variance)를 측정하고, 미리 설정된 가장자리 임계 값을 기준으로 가장자리 감지 모델을 통해 상기 텍스트 프롬프트 이미지 데이터셋 내 각각의 이미지의 가장자리 수를 측정함으로써, 사람 얼굴 이미지만을 포함하고 있는 상기 제1 데이터셋을 생성하는 딥페이크 탐지 학습 시스템.

14

제12 항에 있어서,상기 제1 데이터셋 및 제2 데이터셋을 생성하는 경우,상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 대형 언어 모델(large language model)을 통해 미리 정의된 범주로 얼굴 이미지를 분류하는 제로샷 분류(zero-shot classification)를 수행하고, 상기 텍스트 프롬프트 이미지 데이터셋 내 하나 이상의 스타일 텍스트 프롬프트 이미지를 대상으로 비현실적 스타일 텍스트 프롬프트를 포함하는 이미지를 제거하고, 상기 텍스트 프롬프트 이미지 데이터셋을 대상으로 얼굴 인식 모델을 통해 사람 얼굴이 포함된 이미지만을 선택적으로 유지함으로써 사람 얼굴 이미지만을 포함하고 있는 상기 제2 데이터셋을 생성하는 딥페이크 탐지 학습 시스템.

15

제12 항에 있어서,상기 모멘텀 부스팅 기법을 상기 딥페이크 식별 모델에 적용하는 경우,상기 제1 데이터셋, 상기 제2 데이터셋 및 상기 복수 개의 이미지 데이터셋을 결합하여 결합 데이터셋을 생성하고, 상기 결합 데이터셋의 정보를 추출하고, 상기 결합 데이터셋 내 임의의 얼굴 이미지에 대한 가중치 정보를 추출하고, 상기 결합 데이터셋의 정보, 상기 임의의 얼굴 이미지에 대한 가중치 정보 및 상기 딥페이크 식별 모델의 손실 함수 정보를 기반으로, 상기 임의의 얼굴 이미지의 순간적인 인스턴스에 부여된 난이도 정보를 정량화하는 상기 모멘텀 부스팅 기법을 상기 딥페이크 식별 모델에 적용하는 딥페이크 탐지 학습 시스템.

16

제15 항에 있어서,상기 결합 데이터셋 내 임의의 얼굴 이미지에 대한 가중치 정보를 추출하는 경우,상기 딥페이크 식별 모델의 모멘텀 이동 평균 정보를 기반으로 상기 딥페이크 식별 모델의 예측 값 및 상기 임의의 얼굴 이미지에 대한 실측(Ground Truths) 값 사이의 교차 엔트로피 정보를 측정함으로써, 상기 임의의 얼굴 이미지에 대한 가중치 정보를 추출하는 딥페이크 탐지 학습 시스템.