적응형 음성 합성 장치 및 그 방법
ADAPTIVE VOICE SYNTHESIS DEVICE AND METHODD THEREOF
특허 요약
본 출원의 실시예에 따라, 적응형 음성 합성 장치 및 그 방법이 제공된다. 상기 방법은, 화자의 실시간 발화 시작으로부터 초기의 제 1 음성 데이터를 수집하는 단계; 음성 특징 추출 모델을 통해 학습되지 않은 상기 화자의 상기 제 1 음성 데이터로부터 상기 화자의 제 1 음성 특징을 추출하는 단계; 상기 제 1 음성 데이터에 대응하는 제 1 텍스트를 음성 합성 모델에 입력하고, 상기 제 1 음성 특징에 기초하여 제 1 합성 음성을 출력하는 단계; 상기 화자의 연속되는 발화에 따라 상기 제 1 음성 데이터와 연속하여 적어도 하나의 제 2 음성 데이터를 수집하는 단계; 누적하여 수집되는 상기 제 1 음성 데이터와 상기 제 2 음성 데이터를 기초로 상기 음성 특징 추출 모델을 학습시키는 단계; 상기 음성 특징 추출 모델을 통해 상기 제 2 음성 데이터로부터 상기 화자의 제 2 음성 특징을 추출하는 단계; 및 상기 제 2 음성 데이터에 대응하는 적어도 하나의 제 2 텍스트를 상기 음성 합성 모델에 입력하고, 상기 제 2 음성 특징에 기초하여 제 2 합성 음성을 출력하는 단계를 포함할 수 있다.
청구항
번호청구항
2

제 1 항에 있어서,상기 제 2 음성 데이터를 수집하는 단계에서, 복수의 상기 제 2 음성 데이터가 상기 화자의 연속되는 발화에 따라 소정의 시간 간격으로 연속하여 수집되고,상기 음성 특징 추출 모델을 학습시키는 단계, 상기 제 2 음성 특징을 추출하는 단계 및 상기 제 2 합성 음성을 출력하는 단계는, 상기 제 2 음성 데이터가 수집됨에 따라 반복 수행되는, 방법.

1

적응형 음성 합성 방법에 있어서,화자의 실시간 발화 시작으로부터 초기의 제 1 음성 데이터를 수집하는 단계;음성 특징 추출 모델을 통해 학습되지 않은 상기 화자의 상기 제 1 음성 데이터로부터 상기 화자의 제 1 음성 특징을 추출하는 단계;상기 제 1 음성 데이터에 대응하는 제 1 텍스트를 음성 합성 모델에 입력하고, 상기 제 1 음성 특징에 기초하여 제 1 합성 음성을 출력하는 단계;상기 화자의 연속되는 발화에 따라 상기 제 1 음성 데이터와 연속하여 적어도 하나의 제 2 음성 데이터를 수집하는 단계;누적하여 수집되는 상기 제 1 음성 데이터와 상기 제 2 음성 데이터를 기초로 상기 음성 특징 추출 모델을 학습시키는 단계;상기 음성 특징 추출 모델을 통해 상기 제 2 음성 데이터로부터 상기 화자의 제 2 음성 특징을 추출하는 단계; 및상기 제 2 음성 데이터에 대응하는 적어도 하나의 제 2 텍스트를 상기 음성 합성 모델에 입력하고, 상기 제 2 음성 특징에 기초하여 제 2 합성 음성을 출력하는 단계를 포함하는, 방법.

3

제 2 항에 있어서,제 1 언어의 상기 제 1 음성 데이터를 제 1 음성 인식 텍스트로 변환하고, 번역 모델을 통해 상기 제 1 음성 인식 텍스트를 기초로 제 2 언어로 번역된 상기 제 1 텍스트를 생성하는 단계; 및제 1 언어의 상기 제 2 음성 데이터를 제 2 음성 인식 텍스트로 변환하고, 상기 번역 모델을 통해 상기 제 2 음성 인식 텍스트를 기초로 제 2 언어로 번역된 상기 제 2 텍스트를 생성하는 단계를 더 포함하고,상기 제 2 텍스트를 생성하는 단계는, 상기 제 2 음성 데이터가 수집됨에 따라 반복 수행되는, 방법.

4

제 3 항에 있어서,상기 번역 모델은 복수의 기계 번역 모델을 포함하고,상기 제 1 텍스트를 생성하는 단계 및 상기 제 2 텍스트를 생성하는 단계는,상기 제 1 음성 인식 텍스트 및 상기 제 2 음성 인식 텍스트를 복수의 상기 기계 번역 모델을 이용하여 제 1 언어로 번역하되, 음성 길이가 번역 전의 상기 제 1 음성 데이터 및 상기 제 2 음성 데이터와 가장 유사한 번역 텍스트를 각각 상기 제 1 텍스트 및 상기 제 2 텍스트로 선택함으로써 수행되는, 방법.

5

제 3 항에 있어서,상기 제 1 텍스트를 생성하는 단계 및 상기 제 2 텍스트를 생성하는 단계는,상기 제 1 음성 인식 텍스트 및 상기 제 2 음성 인식 텍스트에서 문장 또는 의미 단위로 적어도 일부의 대상 텍스트를 각각 선택하고, 상기 대상 텍스트를 기초로 번역된 상기 제 1 텍스트 및 상기 2 텍스트를 생성함으로써 수행되는, 방법.

6

제 5 항에 있어서,상기 제 1 음성 인식 텍스트 및 상기 제 2 음성 인식 텍스트 중 상기 대상 텍스트로 선택되지 않은 잔존 텍스트를 후속하여 수집되는 상기 제 2 음성 데이터로부터 변환된 상기 제 2 음성 인식 텍스트에 병합하는 단계를 더 포함하는, 방법.

7

제 2 항에 있어서,상기 음성 특징 추출 모델은,적어도 하나의 LSTM(Long Short-Term Memory)로 구성되는 LSTM 층; 및 상기 LSTM 층 전단에 배치되며 적어도 하나의 합성곱 신경망(Convolutional Neural Network)으로 구성되는 CNN 층을 포함하는, 방법.

8

제 7 항에 있어서,상기 합성곱 신경망은 1차원 합성곱 신경망(1D CNN)인, 방법.

9

적응형 음성 합성 장치에 있어서,음성 데이터를 수집하기 위한 음성 수집부;적어도 하나의 프로세서; 및상기 프로세서에 의해 실행 가능한 프로그램을 저장하는 메모리를 포함하고,상기 프로세서는, 상기 프로그램을 실행함으로써, 상기 음성 수집부를 통해 화자의 실시간 발화 시작으로부터 초기의 제 1 음성 데이터를 수집하고, 음성 특징 추출 모델을 통해 학습되지 않은 상기 화자의 상기 제 1 음성 데이터로부터 상기 화자의 제 1 음성 특징을 추출하며, 상기 제 1 음성 데이터에 대응하는 제 1 텍스트를 음성 합성 모델에 입력하고, 상기 제 1 음성 특징에 기초하여 제 1 합성 음성을 출력하며,상기 음성 수집부를 통해 상기 화자의 연속되는 발화에 따라 상기 제 1 음성 데이터와 연속하여 적어도 하나의 제 2 음성 데이터를 수집하고, 누적하여 수집되는 상기 제 1 음성 데이터와 상기 제 2 음성 데이터를 기초로 상기 음성 특징 추출 모델을 학습시키며, 상기 음성 특징 추출 모델을 통해 상기 제 2 음성 데이터로부터 상기 화자의 상기 제 2 음성 특징을 추출하고, 상기 제 2 음성 데이터에 대응하는 적어도 하나의 제 2 텍스트를 상기 음성 합성 모델에 입력하고, 상기 제 2 음성 특징에 기초하여 제 2 합성 음성을 출력하는, 장치.

10

제 1 항 내지 제 8 항 중 어느 한 항의 방법을 실행하기 위하여 컴퓨터 판독 가능한 기록 매체에 저장된 컴퓨터 프로그램.