기계 학습을 위한 훈련 데이터 샘플링 방법
TRAINING DATA SAMPLING METHOD FOR MACHINE LEARNING
특허 요약
이상치 검출을 위한 기계 학습에 이용될 수 있는 훈련 데이터 샘플링 방법이 개시된다. 개시된 기계 학습을 위한 훈련 데이터 샘플링 방법은 훈련 데이터에 포함된 타겟 샘플의 좌표를 중심으로 하는, 미리 설정된 반지름의 가상의 원을 생성하는 단계; 상기 가상의 원에 포함되며, 상기 타겟 샘플 주변에 위치한 이웃 샘플의 개수 및 좌표를 이용하여, 상기 타겟 샘플에 대한 이상치 확률값을 계산하는 단계; 및 상기 이상치 확률값과 임계값의 크기를 비교하여, 상기 타겟 샘플에 대한 가상 정상치 샘플 또는 가상 이상치 샘플을 생성하는 단계를 포함한다.
청구항
번호청구항
1

컴퓨팅 장치에서 수행되는, 기계 학습을 위한 훈련 데이터 샘플링 방법에 있어서, 훈련 데이터에 포함된 타겟 샘플의 좌표를 중심으로 하는, 미리 설정된 반지름의 가상의 원을 생성하는 단계;상기 가상의 원에 포함되며, 상기 타겟 샘플 주변에 위치한 이웃 샘플의 개수 및 좌표를 이용하여, 상기 타겟 샘플에 대한 이상치 확률값을 계산하는 단계; 및상기 이상치 확률값과 임계값의 크기를 비교하여, 상기 타겟 샘플에 대한 가상 정상치 샘플 또는 가상 이상치 샘플을 생성하는 단계를 포함하는 기계 학습을 위한 훈련 데이터 샘플링 방법.

2

제 1항에 있어서,상기 이상치 확률값을 계산하는 단계는상기 이웃 샘플의 평균 좌표의 지점과 상기 타겟 샘플 사이의 거리값과, 상기 이웃 샘플의 개수값을 이용하여, 상기 이상치 확률값을 계산하는기계 학습을 위한 훈련 데이터 샘플링 방법.

3

제 2항에 있어서,상기 이상치 확률값은상기 거리값에 비례하며, 상기 이웃 샘플의 개수값에 반비례하는 값인기계 학습을 위한 훈련 데이터 샘플링 방법.

4

제 2항에 있어서,상기 이상치 확률값을 계산하는 단계는하기 수학식을 이용하여, 상기 이상치 확률값을 계산하는기계 학습을 위한 훈련 데이터 샘플링 방법.[수학식]여기서, 는 i번째 타겟 샘플과 상기 이웃 샘플의 평균 좌표의 지점 사이의 거리값, 는 i번째 타겟 샘플 주변에 위치하는 상기 이웃 샘플의 개수값, 는 상기 거리값과 상기 이웃 샘플의 개수값의 차이값 중 최소값, 는 상기 거리값과 상기 이웃 샘플의 개수값의 차이값 중 최대값을 나타냄.

5

제 1항에 있어서,상기 가상 정상치 샘플 또는 가상 이상치 샘플을 생성하는 단계는랜덤하게 결정되는 상기 임계값과 상기 이상치 확률값의 크기를 미리 설정된 횟수만큼 비교하는 단계;상기 이상치 확률값이 상기 임계값 이상인 경우, 상기 타겟 샘플을 이용하여 상기 가상 이상치 샘플을 생성하는 단계; 및상기 이상치 확률값이 상기 임계값 미만인 경우, 상기 타겟 샘플을 이용하여, 상기 가상 정상치 샘플을 생성하는 단계를 포함하는 기계 학습을 위한 훈련 데이터 샘플링 방법.

6

제 5항에 있어서,상기 타겟 샘플을 이용하여, 상기 가상 이상치 샘플을 생성하는 단계는상기 타겟 샘플을 기준으로, 상기 훈련 데이터에 포함된 샘플의 밀도가 증가하는 방향을 결정하는 단계; 및상기 밀도가 증가하는 방향의 반대 방향으로, 상기 타겟 샘플로부터 상기 가상의 원의 반지름만큼 이격된 위치에 상기 가상 이상치 샘플을 생성하는 단계를 포함하는 기계 학습을 위한 훈련 데이터 샘플링 방법.

7

제 6항에 있어서, 상기 샘플의 밀도가 증가하는 방향을 결정하는 단계는상기 이웃 샘플 각각과 상기 타겟 샘플 사이의 방향 벡터를 계산하는 단계;상기 방향 벡터의 합에 대응되는 방향을, 상기 밀도가 증가하는 방향으로 결정하는 단계를 포함하는 기계 학습을 위한 훈련 데이터 샘플링 방법.

8

제 5항에 있어서,상기 타겟 샘플을 이용하여, 가상 이상치 샘플을 생성하는 단계는상기 타겟 샘플을 기준으로, 상기 훈련 데이터에 포함된 샘플의 밀도가 증가하는 방향을 나타내는 방향 벡터를 계산하는 단계;상기 타겟 샘플 및 상기 방향 벡터를 이용하여, 가상 직선을 생성하는 단계;상기 이웃 샘플을 상기 가상 직선으로 정사영시키고, 정사영된 좌표의 지점과 상기 타겟 샘플과의 거리 중 최소 거리를 결정하는 단계; 및상기 밀도가 증가하는 방향 방향으로, 상기 타겟 샘플로부터 상기 최소 거리만큼 이격된 위치에 상기 가상 정상치 샘플을 생성하는 단계를 포함하는 기계 학습을 위한 훈련 데이터 샘플링 방법.

9

컴퓨팅 장치에서 수행되는, 기계 학습을 위한 훈련 데이터 샘플링 방법에 있어서,훈련 데이터의 타겟 샘플의 좌표를 중심으로 하는 미리 설정된 반지름의 가상의 구를 생성하는 단계;상기 가상의 구에 포함되며, 상기 타겟 샘플 주변에 위치한 이웃 샘플의 개수 및 좌표를 이용하여, 상기 타겟 샘플에 대한 이상치 확률값을 계산하는 단계; 및상기 이상치 확률값과 임계값의 크기를 비교하여, 상기 타겟 샘플에 대한 가상 정상치 샘플 또는 가상 이상치 샘플을 생성하는 단계를 포함하는 기계 학습을 위한 훈련 데이터 샘플링 방법.

10

제 9항에 있어서,상기 이상치 확률값을 계산하는 단계는상기 이웃 샘플의 평균 좌표의 지점과 상기 타겟 샘플 사이의 거리값과, 상기 이웃 샘플의 개수값을 이용하여, 상기 이상치 확률값을 계산하는기계 학습을 위한 훈련 데이터 샘플링 방법.