RnDCircle Logo
고민삼 연구실
한양대학교 ICT융합학부 고민삼 교수
인간-인공지능 상호작용
Transformer
다중모달 AI
연구 영역
기본 정보
논문·특허
과제
구성원

고민삼 연구실

한양대학교 ICT융합학부 고민삼 교수

고민삼 연구실은 Transformer 기반 딥러닝과 정보추출 방법을 바탕으로 인간 중심 상호작용, 비정형 문서 이해, 비침습 의료 신호 분석의 응용 연구를 수행합니다. 온라인 학습과 정서 지원 대화에서는 맥락과 단계 구조를 활용해 전략 선택 및 응답 생성 성능을 개선하고, 앱 로그를 활용한 종단 관찰로 정서 변화를 분석합니다. 시각 분야에서는 Video Vision Transformer 계열로 카메라 각도 변화에 강건한 생체 신호 검출을 수행하며, 설계 사양 문서에서는 Multi-Span MRC로 Part-Property-Value 정보를 구조화합니다. 의료 분야에서는 LIPS와 호흡 오디오 기반 세그멘테이션을 결합해 피부암 triage 및 수면 무호흡·수면 단계 추정을 비침습으로 구현하는 연구를 수행합니다.

인간-인공지능 상호작용Transformer다중모달 AI정보추출(MRC)비침습 의료 진단
대표 연구 분야
연구 영역 전체보기
정서·교육 맥락의 휴먼-에이전트 상호작용 연구 thumbnail
정서·교육 맥락의 휴먼-에이전트 상호작용 연구
Human-Agent Interaction for Emotion and Education Contexts
연구 분야 상세보기
연구 성과 추이
표시된 성과는 수집된 데이터 기준으로 산출되며, 일부 차이가 있을 수 있습니다.
주요 논문
5
논문 전체보기
1
Article
|
인용수 2
·
2025
ApneaWhisper: Transformer-Based Audio Segmentation for Fine-Grained Non-Invasive Sleep Apnea Detection
Yunu Kim, Myeongbin Kim, Jaemyung Shin, Minsam Ko
IF 3.4 (2025)
Nature and Science of Sleep
목적: 수면무호흡증은 심각한 건강 문제를 수반하는 흔한 수면 장애이다. 본 연구는 PSG-Audio 데이터를 사용하여 수면무호흡증 아형을 비침습적으로 검출하기 위한 Transformer 기반 오디오 분할 모델인 ApneaWhisper를 소개한다. 환자 및 방법: 우리는 284명의 환자에서 수집된 PSG-Audio 데이터셋을 활용하였다. ApneaWhisper는 사전학습된 Whisper 인코더를 활용하여 20초 길이의 오디오 클립에서 10 ms 해상도의 프레임 수준 특징을 추출한다. 토큰 기반 분할과 분류 헤드를 갖춘 경량 Transformer 디코더가 이 특징들을 집계하여 프레임 수준 및 클립 수준 예측을 모두 수행한다. 데이터 불균형을 완화하기 위해, 무호흡 아형 간 클래스 불균형을 고려한 가중 교차 엔트로피 손실을 사용하여 모델을 미세조정하였다. 결과: ApneaWhisper는 수면무호흡증 검출에서 강한 성능을 보였으며, 클립 수준 F1-score는 0.82, 프레임 수준 F1-score는 0.70로 MFCC+DNN, VGGish+bi-LSTM, VAD 기반 모델을 포함한 기존 기준 모델을 능가하였다. 또한 OSA, MSA, CSA 및 저호흡을 구분하는 데에도 유망한 능력을 보였으나, 성공 정도는 아형에 따라 다르게 나타났다. 결론: 모델의 세밀한 시간 해상도는 무호흡 사건의 정밀한 위치 추정, 지속시간 산정, 아형 분류를 가능하게 한다. ApneaWhisper는 OSA에 대해 견고한 성능을 보이는 반면, 중심성(CSA) 및 혼합성(MSA) 수면무호흡을 구분하는 데에는 어려움이 남아 있는데, 이는 미묘하거나 모호한 음향 패턴에 기인한다. 프레임 수준 분할은 또한 정확한 무호흡-저호흡지수(AHI) 추정을 가능하게 하여, 일부 임상 및 가정 모니터링 시나리오에서 전체 PSG 의존도를 낮출 수 있을 것으로 기대된다. 향후 개선은 다중모달 통합(예: 산소포화도)과 소음에 강인한 학습 기법을 포함할 수 있다.
https://doi.org/10.2147/nss.s553774
Segmentation
Sleep apnea
Event (particle physics)
Pattern recognition (psychology)
Temporal resolution
Duration (music)
Apnea
2
Article
|
인용수 0
·
2025
Estimating Sleep-Stage Distribution from Respiratory Sounds via Deep Audio Segmentation
Soo-Hyun Choi, Joshep Shin, Yunu Kim, Jaemyung Shin, Minsam Ko
IF 3.5 (2025)
Sensors
수면의 건축(architecture)에 대한 정확한 평가는 수면장애를 진단하고 관리하는 데 핵심적이며, 이는 전 세계적 건강과 웰빙에 중대한 영향을 미친다. 다원수면검사(polysomnography, PSG)는 임상적 표준(gold standard)으로 남아 있으나, 내재된 침습성, 높은 비용, 그리고 운영상의 복잡성으로 인해 일상적 또는 가정 기반 모니터링에서의 활용이 제한된다. 최근의 발전에 따르면 호흡수 및 주기 규칙성(cycle regularity)과 같은 호흡 역학(respiratory dynamics)의 미세한 변동은 서로 다른 수면 단계와 의미 있는 상관관계를 보이며, 유용한 비침습성 바이오마커로 기능할 수 있다. 본 연구에서는 단일 수면 에피소드 동안 수집된 호흡 음성(respiratory audio)을 기반으로 수면 단계 분포를 추정하는 프레임워크를 제안하며, 구체적으로 Wake(각성), Light(N1+N2), Deep(N3), REM에 대한 분포를 산출한다. 제안된 프레임워크는 세 가지 주요 구성요소로 이루어진다: (1) 미세 조정된 Transformer 기반 아키텍처를 사용하여 호흡 음성에서 서로 다른 호흡 주기를 식별하는 분할(segmentation) 모듈, (2) 분할된 호흡 패턴으로부터 통계적, 스펙트럼적, 분포적(distributional) 기술자(descriptors)로 이루어진 일련의 특징을 도출하는 특징 추출(feature extraction) 모듈, (3) 각 수면 단계에 소요된 시간 비율(proportion)을 예측하는 단계별 회귀(regression) 모델이다. 공공 PSG-Audio 데이터셋(287명; 1인당 평균 5.3시간)에서, 피험자 단위 교차검증을 사용한 실험을 통해 본 접근법의 효과가 입증되었다. 분할 모델은 호흡수 및 주기 지속시간(cycle duration)을 예측하는 데 있어 RMSE와 MAE를 낮추었으며, 고전적인 신호처리 기반(baselines)과 비교해 성능이 우수하였다. 수면 단계 비율 예측의 경우, 제안 방법은 모든 단계에서 유리한 RMSE와 MAE를 보였고, TabPFN 모델이 일관되게 최상의 결과를 제공하였다. 해석 가능한 호흡 특징을 정량화하고 의도적으로 블랙박스 end-to-end 모델링을 회피함으로써, 본 시스템은 수동적 오디오를 이용한 투명하고 비접촉적(contact-free) 수면 모니터링을 지원할 수 있을 것으로 기대된다.
https://doi.org/10.3390/s25206282
Segmentation
Polysomnography
Sleep (system call)
Pattern recognition (psychology)
Feature (linguistics)
Respiratory rate
Sleep Stages
Principal component analysis
3
Article
|
인용수 49
·
2023
Dancing on the inside: A qualitative study on online dance learning with teacher-AI cooperation
Jiwon Kang, Chaewon Kang, Jeewoo Yoon, Houggeun Ji, Taihu Li, Moon Hyunmi, Minsam Ko, Jinyoung Han
IF 4.8 (2023)
Education and Information Technologies
https://doi.org/10.1007/s10639-023-11649-0
Educational technology
Dance
Qualitative research
Mathematics education
Online learning
Pedagogy
Dance education
Psychology
Multimedia
Sociology
최신 정부 과제
4
과제 전체보기
1
2025년 8월-2027년 8월
|64,094,000
비전-언어 모델 기반 다중 Co-Viewer 에이전트 프레임워크
현재의 실시간 영상 시청 환경에서는, 시청자들이 채팅을 통해 감정과 의견을 공유하며 상호작용하는 방식이 일반화되어 있으나, 이러한 대화는 익명성과 무작위성으로 인해 감정 조율이나 관심사의 일치가 어려워, 대화 몰입을 저해하거나 역기능적 발화(도배, 악플 등)를 유발하는 경우가 많다. 인공지능 기술의 발전으로 실시간 챗봇이나 Q&A 형태의 인터페이스가 일부 ...
공동 시청
다중 에이전트
비전-언어 모델
채팅 반응
프롬프트 최적화
2
주관|
2020년 8월-2023년 8월
|348,618,000
디자인사이언스: 빅데이터 기반 디자인 융합 연구
본 과제는 디자인을 감각이 아닌 데이터로 이해·평가·추천하는 ‘디자인사이언스’ 정립 연구임. 온라인 이미지와 반응 데이터, 전문가 평가를 모아 디자인 가치를 정량화함. 연구 목표는 디자인사이언스를 학문적으로 정립하고, 디자인 요소 정량화 및 빅데이터 시스템 기반 추천·가이드·평가 모델을 개발하는 데 있음. 디자인 이미지 객체 추출, 디자인 요소·메타정보·소비자/시장 반응·다면적 평가를 연동한 데이터베이스 및 인터페이스 구축, 딥러닝 기반 모델 학습과 성능평가 수행함. 기대 효과는 디자인 가치의 데이터화와 표준화 기반 마련, 디자인 융복합 연구·산업의 해외 진출 및 인재양성에 기여함.
디자인사이언스
디자인 빅데이터
디자인 빅데이터 플랫폼
이미지 빅데이터
정량적 디자인
디자인 가이드
디자인 추천 시스템
디자인 평가 시스템
계산기반 디자인
기계학습
3
주관|
2018년 2월-2021년 2월
|30,000,000
장애인을 위한 인간-인공지능 상호작용 연구
장애인을 위한 인간-인공지능 상호작용 지원에 필요한 핵심 기술들을‘상황 이해’와 ‘피드백 제공’으로 분류하였습니다. 이 기술들은 세부 응용 서비스(연구 목표) 별 기술 요구 사항에 맞춰 연구, 개발될 것입니다. (1) 상황 이해를 윈한 상호작용 지원 기술: 인공지능이 사용자 주변 객체에 대한 인식부터, 사용자의 현재 상태 및 동작, 나아가는 주변 상황과 분위기를 이해하는데 필요한 기술 ① 상황 데이터 수집 및 센싱 기술: 감각 대체(sensory substitution)를 위해 필요한 행동 인식을 위하여 다양한 센서들의 효율적인 조합을 탐색합니다. 또한, 수집된 센서 데이터를 활용하여 객체/행동/표정/감정 등에 대한 이미지/음성 인식 딥러닝 모델 구축하여 인식 성능의 고도화하는 방안을 연구합니다. ② 적응형 기계 학습을 통한 상황 변화 대응 기술: 사용자 모델링이나 상황 모델링이 고정되어 있는 것이 아니라, 입력되는 데이터에 따라 유연하게 수정되고 적응할 수 있는 적응형 기계 학습 기술을 연구합니다. ③ 선제적 상호작용을 통한 상황 인지 고도화 기술: 상황 인지의 성능을 높일 수 있는 선제적 상호작용의 방법과 시점 등을 연구합니다 (2) 피드백 제공 상호작용 지원 기술 : 사용자의 현 상태와 상황에 따라 적합한 컨텐츠를 적절한 시점에 개인화 된 모달리티로 사용자에게 전달하는 기술을 말합니다. ① 피드백 제공 방식 디자인 연구: 다양한 피드백 제공 방식에 대한 사용자 스터디를 수행합니다 (상호작용 피드백 방식, 행동 유도 방법 등). 나아가 Generative Adversarial Network 활용하여 피드백 방식의 변형을 주어 새로운 자극을 주는 방법을 연구합니다. ② 행동 변화 유도를 위한 설득 컴퓨팅 연구: 인공지능의 행동 유도 상호작용이 어떻게 디자인되어야 사용자에게 신뢰를 받을 수 있을지, 사용자가 더 나은 결정을 하기 위해서는 어떠한 정보를 제공해야 될지 연구합니다. ③ 최적의 개입 상호작용 시점 탐색 기술: 인간-인공지능 상호작용 시 잠재적 부작용에 대해 고려하여, 상호작용 방법과 발생을 균형 있게 잘 조절하는 방안을 연구합니다.
인간-인공지능 상호작용
장애인
상황 인지
인공지능
서비스 디자인
접근성
행동 변화
객체 인식
행동 인식
최신 특허
특허 전체보기
상태출원연도과제명출원번호상세정보
소멸2016IoT 기반 지능형 인형 시스템을 활용한 그룹 사용자 스마트기기 과도사용 중재 방법 및 시스템1020160080054
소멸2015근거리 그룹 사용자의 사회적 상호작용 증진을 위한 그룹 기반 스마트 기기 사용 중재 방법1020150084862
소멸2014스마트 기기 사용 조절을 위한 협력적 중재 시스템 및 방법1020140134332
전체 특허

IoT 기반 지능형 인형 시스템을 활용한 그룹 사용자 스마트기기 과도사용 중재 방법 및 시스템

상태
소멸
출원연도
2016
출원번호
1020160080054

근거리 그룹 사용자의 사회적 상호작용 증진을 위한 그룹 기반 스마트 기기 사용 중재 방법

상태
소멸
출원연도
2015
출원번호
1020150084862

스마트 기기 사용 조절을 위한 협력적 중재 시스템 및 방법

상태
소멸
출원연도
2014
출원번호
1020140134332