연구 영역
기본 정보
논문·특허
과제
구성원
읽는 시간 · 1분 17초

생체 모사 연성 센서 기반 음향의 영상화와 CNN 기반 음성 인식 전처리 연구

Bio-inspired soft sensing for acoustic-to-visual transformation and CNN-based speech recognition preprocessing

연구 내용

압전 기반 음향을 고해상도 영상으로 변환하고, 생체 모사 다이어프램 응답을 활용해 CNN 기반 음성 인식 입력을 생성하는 연구

본 연구는 생체 모사형 viscoelastic diaphragm(고막 모사 구조)의 위상 변이 진동 응답을 이용해 audio visualization 이미지를 생성하는 접근을 수행합니다. 입력 이미지 생성을 위해 cross-recurrence plot 기반 영상 표현을 구성하고, 두 위상 응답을 결합하여 STFT 기반 스펙트로그램을 대체하거나 연산 부담을 낮추는 전처리 입력을 설계합니다. 또한 압전 포토닉 복합재 및 음향 가시화 개념을 기반으로 음향을 주파수 영상으로 변환하는 변환 시스템을 기술화하여 소형화와 경량 디바이스 적용 가능성을 목표로 합니다. 최종적으로 CNN 기반 음성 인식 파이프라인에서 입력 표현의 유효성을 검증합니다.

관련 연구 성과

관련 논문

1

관련 특허

1

관련 프로젝트

2

연구 흐름

초기에는 고막(tympanic membrane) 유사 연성 다이어프램의 두 위상 응답을 이용해 음향을 영상 형태로 변환하는 생성 원리를 정립했습니다. 이후 cross-recurrence plot을 결합하여 서로 다른 입력 이미지 표현을 구성하고, 이미지 해상도 조건에서 기존 스펙트로그램 대비 연산 부담과 성능의 균형 가능성을 확인했습니다. 병행하여 음향을 고화질 주파수 영상으로 변환하는 시스템을 압전 포토닉 복합재 기반 음향 가시화로 구현하는 기술 개발 과제로 확장했습니다. 이를 통해 음성 인식 전처리 입력의 구현성을 높이는 흐름으로 진행되었습니다.

활용 가능성

활용 가능성은 알앤디써클 특화 AI 에이전트가 생성한 내용으로, 실제 연구 가능 여부는 연구실과의 논의가 필요합니다.

  • 음향-영상 변환 기반 음성 인식
  • 저연산 스펙트로그램 대체 전처리
  • 경량 웨어러블 음성 입력기
  • 마이크로폰 기반 사운드 이벤트 분류
  • 멀티모달 학습용 오디오 비주얼 입력
  • 엣지 디바이스용 전처리 파이프라인
  • 청각 보조 및 커뮤니케이션 보조
  • 음향 프라이버시 강화용 표현 변환
  • 실시간 오디오 분석용 입력 생성
  • 비접촉/소형 센서 시스템 통합
  • 음향 데이터 품질 향상 전처리

관련 논문

구분

제목

1

Eardrum-inspired soft viscoelastic diaphragms for CNN-based speech recognition with audio visualization images

관련 특허

구분

제목

1

음성 영상 변환 시스템 및 방법

관련 프로젝트

구분

제목

1

압전 포토닉 복합재 기반 음향 가시화를 이용한 음성 인식

2

압전 포토닉 복합재 기반 음향 가시화를 이용한 음성 인식