특허 개요
본 특허는 이미지와 문서에서 얻은 정보를 함께 활용해 언어 모델의 상식적 문장 생성을 돕는 일반 상식 추론 기반 언어 생성 장치 및 방법입니다. 입력 개념을 바탕으로 이미지에서는 일반적 상황을 나타내는 장면 지식을 추출하고, 문서에서는 개념 간 관계를 나타내는 관계 지식을 추출한 뒤 이를 시퀀스로 인코딩·병합하여 언어 모델 학습 또는 문장 생성에 사용합니다. 이미지 지식은 비트겐슈타인 그림 이론 기반 생성적 상식 추론으로, 문서 지식은 비트겐슈타인 사용 이론과 문서 관련성 점수·개념 유사도 선별 방식으로 확보합니다.
- 핵심 기능
입력된 개념·이미지·문서에서 장면 지식과 관계 지식을 각각 추출하고, 관련성이 높은 관계 지식 문장을 선별합니다. 두 지식을 병합한 입력을 언어 모델에 제공해 개념 조합의 상황과 관계를 반영한 문장을 학습하거나 생성합니다.
- 차별 강점
기존 자기회귀 언어 모델은 입력 개념을 누락하거나 상식적으로 이해하기 어려운 문장을 생성할 수 있으며, 일반 상식 추론이 부족한 한계가 있었습니다. 본 특허는 이미지 기반 장면 지식과 문서 기반 관계 지식을 결합해 시각적 상황과 비시각적 관계를 함께 반영하고, 문서 관련성 및 개념 유사도로 관계 지식 후보를 선별하는 점에서 차별화됩니다.
- 활용 범위
기술·연구 측면에서는 일반 상식 추론 기반 대화·문장 생성, 이미지·문서 결합 멀티모달 언어 생성, 지식 검색 연계 질의응답, 자연어처리 기반 정보처리 분야에 활용 가능합니다. 사업 측면에서는 고객상담·업무지원 AI, 교육용 질의응답, 콘텐츠·이메일·기사 생성, 도메인 특화 언어 모델 서비스로 확장할 수 있습니다.
연구 개발 단계
명세서는 개념·이미지·문서를 입력으로 받아 장면 지식과 관계 지식을 추출·병합하고 언어 모델 학습에 이용하는 처리 구조를 제시합니다. 다만 데이터셋별 정량 성능, 대규모 모델 학습·추론 비용, 도메인별 재현성과 서비스 환경 신뢰성은 제시되지 않았습니다.
- 입력 데이터: 개념 집합, 이미지, 문서
- 지식 구성: 이미지 기반 장면 지식과 문서 기반 관계 지식
- 문장 선별 조건: 문서 관련성 점수 및 개념 간 유사도가 높은 관계 지식 후보
현재 성과
이미지에서 추출한 장면 지식으로 개념 조합의 일반적 상황을 반영하고, 문서에서 추출한 관계 지식으로 개념 간 관계를 보완합니다. 이를 통해 개념 누락이나 정보 부족으로 상식적으로 이해하기 어려운 문장 생성을 방지하는 것을 목표로 합니다.
입력 개념·이미지·문서로부터 장면 지식과 관계 지식을 추출하고, 각각을 시퀀스로 변환·병합해 언어 모델 학습 또는 생성에 사용하는 구조가 명세서에 제시됩니다. 관계 지식은 문서 관련성 점수와 개념 간 유사도를 이용해 관련 문장을 선별하도록 구성됩니다.
기존 문장 생성 기술은 일반 상식 추론 부족으로 개념 누락 또는 어색한 문장을 생성할 수 있었습니다. 본 특허는 비트겐슈타인 그림 이론 기반의 이미지 장면 지식과 사용 이론 기반의 문서 관계 지식을 병합 입력으로 활용하는 점이 핵심 차별점입니다.
상용화까지 남은 부분
실제 데이터셋과 과업별 정량 성능 비교 및 재현성 검증
대규모 언어 모델 적용 시 학습·추론 비용과 처리 지연 검증
도메인별 이미지·문서 지식 품질 관리 및 서비스 환경 신뢰성 검증
기술 이전 형태·도입 과정
도입은 이렇게 진행됩니다.
검토 미팅
귀사 상황·데이터 구조 기준으로 적합성을 논의합니다. 자료 검토만으로 끝나도 됩니다.
PoC 공동 검증
연구팀 동행 하에 귀사 데이터 기준 재학습·성능을 확인합니다.
라이센싱 계약
PoC 결과를 기반으로 희망 형태(실시권·공동연구 등)를 협의합니다.
기술지도·후속
도입 초기 기술지도, 필요 시 후속 공동연구·정부과제 연계까지 진행합니다.
특허 정보
일반 상식 추론 기반의 언어 생성 장치 및 방법
10-2021-0127435 (2021.09.27)
1020230044834 (2023.04.04)
1025934630000 (2023.10.19)
임희석, 서재형
고려대학교 산학협력단
고려대학교 산학협력단