키워드 기반 자동 연구 구조화 방법 및 연구 구조화 장치
METHOD OF AUTOMATICALLY STRUCTURING RESEARCH BASED ON KEWORD AND DEVICE THEREOF
특허 요약
본 발명의 실시예에 따른 입력 키워드를 기반으로 하여 자동으로 연구를 구조화하는 연구 구조화 장치는 저장장치, 외부로부터 특정 연구 분야와 관련된 입력 키워드를 입력받는 입출력장치, 및 입력 키워드를 기반으로 하여 획득한 문헌 정보를 수집하고, 문헌 정보에 포함된 텍스트로부터 연구 키워드를 추출하며, 문헌 정보 및 연구 키워드에 기반하여 키워드 네트워크를 생성하여 저장장치에 저장하고, 키워드 네트워크에서 주요 키워드를 선별하여 주요 키워드 네트워크를 구성하고, 주요 키워드 네트워크를 모듈화하여 저장장치에 저장하며, 주요 키워드 네트워크에 기반하여 주요 키워드에 대한 분석 결과를 입출력장치를 통해 제공하는 연산장치를 포함하며, 이에 따라 과학계량학 또는 서지정보학에 관한 분석의 모든 과정을 자동화하기 때문에, 해당 분석에 대한 전문 지식을 갖추지 않은 이용자가 쉽게 연구 구조화 및 연구 동향 분석이 가능하다.
청구항
번호청구항
3

제1항에 있어서,상기 문헌 정보를 추출하는 단계는, 상기 입력 키워드가 포함된 문헌 정보를 데이터베이스 검색엔진으로부터 수집하는 단계, 상기 문헌 정보 중 중복된 문헌 정보의 제목, 초록 및 발행연도를 통합하여 통합된 문헌 정보를 생성하는 단계, 상기 문헌 정보 내 텍스트의 특수문자를 제거하고, 문장 부호 양끝에 공백을 추가하며, 다중 공백을 제거하는 전처리 과정을 수행하는 단계, 및 상기 전처리 과정이 수행된 텍스트를 데이터베이스에 저장하는 단계를 포함하는, 방법.

1

컴퓨팅 장치에 의해 수행되는 입력 키워드를 기반으로 하여 자동으로 연구를 구조화하는 방법에 있어서,외부로부터 특정 연구 분야와 관련된 입력 키워드를 입력받는 단계; 상기 입력 키워드를 기반으로 하여 획득한 문헌 정보를 수집하는 단계; 상기 문헌 정보에 포함된 텍스트로부터 연구 키워드를 추출하는 단계; 상기 문헌 정보 및 상기 연구 키워드에 기반하여 키워드 네트워크를 생성하는 단계; 상기 키워드 네트워크로부터 주요 키워드를 선별하여 주요 키워드 네트워크를 구성하는 단계;상기 주요 키워드 네트워크를 모듈화하는 단계; 및상기 주요 키워드 네트워크에 기반하여 상기 주요 키워드에 대한 분석 결과를 제공하는 단계를 포함하는, 방법.

2

제1항에 있어서,상기 분석 결과를 제공하는 단계는, 상기 문헌 정보 내 발행연도 및 상기 주요 키워드를 기반으로 하여 연구 전체 성숙도를 평가하는 단계, 상기 문헌 정보 내 발행연도 및 상기 주요 키워드를 기반으로 하여 생성된 키워드 커뮤니티 별 동향을 분석하는 단계, 및상기 문헌 정보 내 발행연도 및 상기 주요 키워드를 기반으로 하여 생성된 키워드 커뮤니티 내 주요 키워드 변화를 분석하는 단계를 포함하는, 방법.

4

제1항에 있어서,상기 연구 키워드를 추출하는 단계는, 상기 문헌 정보 내 텍스트를 공백을 구분자로 하여 단어로 분리하여 토큰화하는 단계, 상기 텍스트 중 축약어를 제외한 토큰을 소문자화하는 단계, 상기 텍스트 중 영문 알파벳으로 구성된 토큰을 제외한 나머지 토큰을 제거하는 단계, 상기 텍스트의 문장 내 토큰의 Universal part-of-speech(UPOS) 태그를 예측하여 명사, 고유명사, 형용사 및 축약어가 아닌 단어를 제거하는 단계, 상기 텍스트 중 단일 단어로 의미를 가지지 않는 불용어를 제거하는 단계 및 공백 단위로 분리된 연구 키워드를 추출하는 단계를 포함하는, 방법.

5

제1항에 있어서,상기 키워드 네트워크를 생성하는 단계는, 상기 연구 키워드의 문장 내 배치 순서를 기준으로 좌우 단어 또는 전체 단어와 그래프 엣지를 생성하는 단계, 상기 연구 키워드의 연결 관계 형성 빈도수를 가중치로 저장하는 단계, 상기 연구 키워드에 대하여 빈도 수 및 문헌 정보 내 발행 연도를 노드 데이터에 포함시켜 저장하는 단계, 및 전체 텍스트에서 반복하여 전체 문헌 정보가 포함된 키워드 네트워크를 생성하는 단계를 포함하는, 방법.

6

제1항에 있어서,상기 주요 키워드 네트워크를 구성하는 단계는,페이지랭크(PageRank) 알고리즘을 이용하여 상기 키워드 네트워크의 노드에 대한 노드 별 페이지랭크 스코어(PageRank score)를 계산하는 단계, 페이지랭크 스코어(PageRank score)를 기준으로 노드를 정렬하는 단계, 및상위 노드의 빈도수의 합이 전체 빈도수 합의 80%에 해당하는 주요 키워드를 선별하는 단계를 포함하며, 상기 주요 키워드 네트워크를 모듈화하는 단계는, 루벵 모듈성(Louvain's modularity) 알고리즘을 이용하여 네트워크의 모듈성이 극대화되도록 상기 선별된 주요 키워드로 구성된 주요 키워드 네트워크에 대하여 네트워크 모듈화를 수행하는 단계,상기 네트워크 모듈화의 분류 결과를 상기 주요 키워드 네트워크의 노드에 저장하는 단계, 및동일한 모듈로 분류된 노드의 집합을 키워드 커뮤니티로 정의하여 연구 구조화를 수행하는 단계를 포함하는,방법.

7

입력 키워드를 기반으로 하여 자동으로 연구를 구조화하는 연구 구조화 장치에 있어서, 저장장치; 외부로부터 특정 연구 분야와 관련된 입력 키워드를 입력받는 입출력장치; 및상기 입력 키워드를 기반으로 하여 획득한 문헌정보를 수집하고, 상기 문헌 정보에 포함된 텍스트로부터 연구 키워드를 추출하며, 상기 문헌 정보 및 상기 연구 키워드에 기반하여 키워드 네트워크를 생성하여 상기 저장장치에 저장하고, 상기 키워드 네트워크로부터 주요 키워드를 선별하여 구성한 주요 키워드 네트워크를 상기 저장장치에 저장하며,상기 주요 키워드 네트워크를 모듈화하여 상기 저장장치에 저장하며, 상기 주요 키워드 네트워크에 기반하여 상기 주요 키워드에 대한 분석 결과를 상기 입출력장치를 통해 제공하는 연산장치를 포함하는, 연구 구조화 장치.

8

제7항에 있어서,상기 연산장치는, 상기 문헌 정보 내 발행연도 및 상기 주요 키워드를 기반으로 하여 연구 전체 성숙도를 평가하고, 상기 문헌 정보 내 발행연도 및 상기 주요 키워드를 기반으로 하여 생성된 키워드 커뮤니티 별 동향을 분석하며, 상기 문헌 정보 내 발행연도 및 상기 주요 키워드를 기반으로 하여 생성된 키워드 커뮤니티 내 주요 키워드 변화를 분석하는 것을 특징으로 하는, 연구 구조화 장치.

9

제7항에 있어서,상기 연산장치는, 상기 입력 키워드가 포함된 문헌 정보를 데이터베이스 검색엔진으로부터 수집하고, 상기 문헌 정보 중 중복된 문헌 정보의 제목, 초록 및 발행연도를 통합하여 통합된 문헌 정보를 생성하며, 상기 문헌 정보 내 텍스트의 특수문자를 제거하고, 문장 부호 양끝에 공백을 추가하며, 다중 공백을 제거하는 전처리 과정을 수행하고, 상기 전처리 과정이 수행된 텍스트를 데이터베이스에 저장하는 것을 특징으로 하는, 연구 구조화 장치.

10

제7항에 있어서,상기 연산장치는, 상기 문헌 정보 내 텍스트를 공백을 구분자로 하여 단어로 분리하여 토큰화하고, 상기 텍스트 중 축약어를 제외한 토큰을 소문자화하며, 상기 텍스트 중 영문 알파벳으로 구성된 토큰을 제외한 나머지 토큰을 제거하고, 상기 텍스트의 문장 내 토큰의 Universal part-of-speech(UPOS) 태그를 예측하여 명사, 고유명사, 형용사 및 축약어가 아닌 단어를 제거하며, 상기 텍스트 중 단일 단어로 의미를 가지지 않는 불용어를 제거하고, 공백 단위로 분리된 연구 키워드를 추출하는 것을 특징으로 하는, 연구 구조화 장치.

11

제7항에 있어서,상기 연산장치는, 상기 연구 키워드의 문장 내 배치 순서를 기준으로 좌우 단어 또는 전체 단어와 그래프 엣지를 생성하고, 상기 연구 키워드의 연결 관계 형성 빈도수를 가중치로 저장하며, 상기 연구 키워드에 대하여 빈도 수 및 문헌 정보 내 발행 연도를 노드 데이터에 포함시켜 저장하고, 전체 텍스트에서 반복하여 전체 문헌 정보가 포함된 키워드 네트워크를 생성하는 것을 특징으로 하는, 연구 구조화 장치.

12

제7항에 있어서,상기 연산장치는, 페이지랭크(PageRank) 알고리즘을 이용하여 상기 키워드 네트워크의 노드에 대한 노드 별 페이지랭크 스코어(PageRank score)를 계산하고, 페이지랭크 스코어(PageRank score)를 기준으로 노드를 정렬하며, 상위 노드의 빈도수의 합이 전체 빈도수 합의 80%에 해당하는 주요 키워드를 선별하고,루벵 모듈성(Louvain's modularity) 알고리즘을 이용하여 네트워크의 모듈성이 극대화되도록 상기 선별된 주요 키워드로 구성된 주요 키워드 네트워크에 대하여 네트워크 모듈화를 수행하며, 상기 네트워크 모듈화의 분류 결과를 상기 주요 키워드 네트워크의 노드에 저장하고, 동일한 모듈로 분류된 노드의 집합을 키워드 커뮤니티로 정의하여 연구 구조화를 수행하는 것을 특징으로 하는, 연구 구조화 장치.