숫자 연산이 가능한 기계독해기반 질의응답 장치 및 방법

TRL 4
등록

이 특허는 한국어 문서 속 숫자와 질문을 함께 읽고, 단순히 문장을 찾는 데 그치지 않고 덧셈·뺄셈·비교·정렬 같은 계산이 필요한 답을 찾는 인공지능 기술입니다. 숫자 사이의 관계를 연결해 분석하고 질문에 맞는 계산 방식을 선택해 답을 만들므로, 통계·날짜·기록 정보가 많은 문서에서 더 정확한 질의응답 서비스를 구축할 수 있는 특허입니다.

특허 개요

본 특허는 문서 속 숫자를 이해하고 계산까지 수행하는 한국어 기계독해 질의응답 모델입니다. KoELECTRA가 단락과 질의를 인코딩한 뒤, NumNet 또는 NumNet+가 숫자를 노드와 숫자 간 대수 관계를 엣지로 하는 그래프로 구성하고, NABERT가 필요한 수치 연산자를 선택해 범위·카운트·대수식 형태의 정답을 예측합니다. 숫자 포함 단락을 수집하고 어노테이터 작성 답변을 언어모델 출력 및 교차 검토로 검증하는 학습 데이터 구축 절차도 포함합니다.

  • 핵심 기능

텍스트에서 숫자를 포함한 단락을 추출하고, 질의·정답 데이터를 구축해 사전학습 언어모델 기반 질의응답 모델을 학습합니다. 실행 시에는 타겟 단락과 질의의 숫자 관계를 그래프로 분석하고, 질의에 적합한 연산자를 선택해 숫자형·날짜형·범위형 응답을 예측합니다.

  • 차별 강점

기존 한국어 기계독해는 문맥 내 답 구간을 추출하거나 문맥에 없는 답을 찾는 방식이 중심이어서, 숫자 간 관계를 계산해 결과를 도출하는 질의 처리에 한계가 있었습니다. 본 특허는 NumNet 또는 NumNet+의 숫자 관계 그래프와 NABERT의 연산자 선택을 결합해 숫자 추출뿐 아니라 사칙연산·비교·정렬 추론을 처리하는 점이 차별점입니다.

  • 활용 범위

기술·연구 측면에서는 한국어 질의응답, 숫자·통계 정보 기반 문서 검색, 스포츠·역사 문서 기계독해, 교육용 질의응답 데이터셋 구축 및 도메인 특화 자연어처리 모델 학습에 활용 가능하며, 사업 측면에서는 에듀테크, 고객상담·업무지원 AI, 지식검색, 통계·기록 기반 정보 서비스로 확장할 수 있습니다.

연구 개발 단계

TRL 1
기초 원리
TRL 2
개념 정립
TRL 3
개념 검증
TRL 4
실험실 검증
TRL 5
유사 환경
TRL 6
시제품
TRL 7
실증
TRL 8
인증완료
TRL 9
사업화
TRL4한국어 숫자 연산 기계독해 모델을 구축하고 학습 데이터 기반의 학습·평가로 동작을 검증한 단계입니다.
현재 검증 내용

KBO 뉴스와 한국민족문화대백과사전 역사 데이터에서 추출한 숫자 포함 문단을 활용해 Ko-Glove 100d 기반 NumNet, KoELECTRA 기반 NAKoELECTRA, KoELECTRA 기반 NumNet+를 EM·F1로 평가했습니다. KoELECTRA 기반 NumNet+의 학습·평가 결과와 어노테이터 교차 검토 절차는 제시됐지만, 다른 도메인·대규모 데이터 및 실제 서비스 환경에서의 일반화 성능은 추가 검증이 필요합니다.

검증 환경

- 평가 대상: 한국어 숫자 연산 기계독해 질의응답 모델
- 비교 모델: Ko-Glove 100d 기반 NumNet, KoELECTRA 기반 NAKoELECTRA, KoELECTRA 기반 NumNet+

- 데이터·평가 조건: 숫자 포함 문단 1,200개, train·dev·test=8:1:1, EM·F1 평가

현재 성과

성능·효과
KoELECTRA 기반 NumNet+의 테스트 성능Test EM 0.176, F1 0.184

KoELECTRA 기반 NumNet+ 모델은 숫자 관계 그래프를 바탕으로 범위·카운트·대수식 답변을 예측하도록 학습·평가됐습니다. 제시된 결과는 숫자 연산형 기계독해 과제에서 모델 성능을 EM과 F1로 확인한 값입니다. 실제 서비스 데이터에서의 성능은 별도 PoC로 확인해야 합니다.

검증·신뢰
학습 데이터 교차 검토 절차

질의·정답 쌍은 8명의 어노테이터가 두 파트로 나누어 작성하고 반대편 4명이 크로스 체크했으며, 2명의 전문가 수퍼바이저가 추가 검토했습니다. 범위·날짜형 응답은 사전학습 언어모델 출력과 어노테이터 응답을 대조해 불일치 시 수정 요청하는 절차를 적용했습니다.

차별성·독창성
숫자 관계 그래프와 연산자 선택의 결합

기존 기계독해의 범위 추출 중심 접근과 달리, 숫자를 노드로 하고 숫자 간 대수 관계를 엣지로 표현하는 NumNet 또는 NumNet+를 활용합니다. 여기에 NABERT가 질의별 수치 연산자를 선택하도록 구성해 숫자 간 연산·비교·정렬이 필요한 응답을 처리하는 점이 핵심 차별성입니다.

상용화까지 남은 부분

1

KBO 뉴스와 역사 데이터 외 산업별 문서 및 대규모 데이터에서의 일반화 성능 검증

2

학습 데이터의 품질 수준과 오류 원인에 대한 체계적 분석 및 도메인별 데이터 구축

3

실제 서비스 환경의 질의 유형, 응답 정확도, 운영 성능에 대한 PoC 검증

기술 이전 형태·도입 과정

기술양도
전용실시권
통상실시권
공동 과제 수행
기술지도·자문

도입은 이렇게 진행됩니다.

1

검토 미팅

귀사 상황·데이터 구조 기준으로 적합성을 논의합니다. 자료 검토만으로 끝나도 됩니다.

2

PoC 공동 검증

연구팀 동행 하에 귀사 데이터 기준 재학습·성능을 확인합니다.

3

라이센싱 계약

PoC 결과를 기반으로 희망 형태(실시권·공동연구 등)를 협의합니다.

4

기술지도·후속

도입 초기 기술지도, 필요 시 후속 공동연구·정부과제 연계까지 진행합니다.

특허 정보

발명의 명칭(KR)

숫자 연산이 가능한 기계독해기반 질의응답 장치 및 방법

출원번호

10-2022-0132670 (2022.10.14)

공개번호

1020240052511 (2024.04.23)

등록번호

10-2966653

발명자

임희석, 김경민

권리자

고려대학교 산학협력단

출원인

고려대학교 산학협력단

문의

담당자이준구
이메일jg.lee@rndcircle.io
연락처010-8978-6417