연구 영역
기본 정보
논문·특허
과제
구성원
Article|
인용수 6
·2023
Eardrum-inspired soft viscoelastic diaphragms for CNN-based speech recognition with audio visualization images
Seok-Jin Park, Hee‐Beom Lee, Gi‐Woo Kim
IF 3.8 (2023) Scientific Reports
초록

본 연구에서는 CNN(컨볼루션 신경망) 기반 음성 인식을 위한 서로 다른 입력 이미지를 생성하는 새로운 음성 인식 접근법에 대한 초기 시도를 제시한다. 우리는 교차 재귀 플롯(cross-recurrence plot, CRP)을 이용하여 음향 시각화 이미지를 전달할 수 있는 고막(eardrum) 영감의 점탄성 막-유형 다이어프램의 잠재력을 탐색하였다. 이러한 이미지는 점탄성 다이어프램의 두 위상-이동(vibration) 진동 응답으로부터 형성되었다. 본 기법은 현재 음성 인식에 사용되는 고속 푸리에 변환(fast Fourier transform, FFT) 스펙트럼을 대체할 수 있을 것으로 기대한다. 여기서는 점탄성 다이어프램의 두 위상-이동 진동 응답을 CRP와 결합하여 생성한 색상 이미지의 새로운 생성 방법이, 이미지 해상도(픽셀 크기)가 임계 해상도 이하일 때 더 낮은 계산 부담과 STFT(통상적 스펙트로그램)에 대한 유망한 대안적 가능성을 보여준다는 점을 보고한다.

*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.

키워드
EardrumComputer scienceVisualizationSpeech recognitionArtificial intelligencePattern recognition (psychology)Acoustics
타입
Article
IF / 인용수
3.8 / 6
게재 연도
2023