연구 영역
기본 정보
논문·특허
과제
구성원
읽는 시간 · 1분 19초

비전·문서 정보추출을 결합한 다중모달 AI 연구

Multimodal AI for Vision and Document Information Extraction

연구 내용

비전 트랜스포머로 영상 생체 신호를 검출하고, 기계독해 기반으로 설계 문서의 P-R-V를 구조화하며, 이를 비전-언어 에이전트로 확장하는 연구

연구는 시각 입력에서 시간적 변화를 정밀하게 포착하는 모델링과, 비정형 설계 문서에서 핵심 정보를 구조화하는 정보추출을 함께 다룹니다. 눈 깜박임 검출에서는 Tubelet embedding과 Residual embedding을 결합한 Dual Embedding Video Vision Transformer로 카메라 각도 변화에 강건한 검출을 수행합니다. 동시에 Machine Reading Comprehension을 기반으로 설계 사양 문서에서 Part-Property-Value를 다중 스팬으로 추출하는 Multi-Span MRC를 적용하여 기존 단일 스팬 방식보다 추출 정확도를 높입니다. 더 나아가 비전-언어 모델 기반 Co-Viewer 에이전트와 디자인 빅데이터 플랫폼의 연계로, 구조화된 지식과 시각 맥락을 동시에 활용하는 방향을 추진합니다.

관련 연구 성과

관련 논문

2

관련 특허

0

관련 프로젝트

2

연구 흐름

문서 중심의 정보추출에서 Machine Reading Comprehension을 활용해 공정·설계 사양의 비정형 텍스트를 구조화하는 연구를 시작했습니다. 이후 영상 데이터로 확장하여 눈 깜박임처럼 작은 영역의 빠른 동작을 안정적으로 검출하기 위한 Dual Embedding 기반 Video Vision Transformer를 제안했습니다. 동시에 디자인사이언스와 설계 빅데이터의 축적을 통해 정량적 설계 평가와 추천에 필요한 데이터 파이프라인을 구축했습니다. 최근에는 비전-언어 모델 기반 다중 Co-Viewer 에이전트 프레임워크로, 영상 관찰과 대화형 질의·반응을 함께 처리하는 멀티모달 응용으로 발전시키고 있습니다.

활용 가능성

활용 가능성은 알앤디써클 특화 AI 에이전트가 생성한 내용으로, 실제 연구 가능 여부는 연구실과의 논의가 필요합니다.

  • 멀티각도 생체영상 검출
  • 비정형 설계문서 자동 구조화
  • P-R-V 기반 설계 지식 그래프 구축
  • 설계 추천 시스템 고도화
  • 설계 평가 시스템 자동화
  • 설명 가능한 정보추출 파이프라인
  • 비전-언어 질의응답
  • 도면·사양 문서 검색 고도화
  • 다중 에이전트 공동 시청 도구
  • 엔지니어링 문서 품질 점검

관련 논문

구분

제목

1

Robust Eye Blink Detection Using Dual Embedding Video Vision Transformer

2

Structurization of Equipment Specification Documents Through Machine Reading Comprehension

관련 프로젝트

구분

제목

1

비전-언어 모델 기반 다중 Co-Viewer 에이전트 프레임워크

2

디자인사이언스: 빅데이터 기반 디자인 융합 연구