특허 개요
본 특허는 사용자 질의와 질의응답 데이터베이스를 비교해 적합한 답변 후보를 찾는 의미 유사도 기반 응답 획득 기술입니다. 질의를 토큰화해 BM25 기반 희소 임베딩 점수를 산출하고, 입력 문장과 후보 문장을 바이 인코더 또는 크로스 인코더로 벡터화해 밀집 임베딩 유사도를 계산합니다. 서로 다른 두 점수는 아크탄젠트 스케일링으로 정규화한 뒤 가중합하여 최종 스코어를 산출하고, 상위 후보 응답을 반환합니다.
- 핵심 기능
입력 질의와 질의응답 데이터베이스의 과거 질의·응답을 이용해 BM25 기반 어휘 검색 점수를 계산하고, 입력 문장과 후보 문장의 코사인 유사도로 의미 기반 점수를 계산합니다. 두 점수를 아크탄젠트 함수로 스케일링하고 가중합하여 후보 응답의 우선순위를 정합니다.
- 차별 강점
기존 자동 질의응답 시스템은 정해진 슬롯 형태의 질의에 정확히 답하기 쉽고, 문장 구조가 달라지면 같은 문맥도 다르게 처리할 수 있었습니다. 본 기술은 BM25 희소 검색과 인코더 기반 밀집 검색을 결합해 어휘 일치와 문맥 유사도를 함께 반영하며, 전문 용어를 포함한 산업 도메인 질의 대응 부담을 완화합니다.
- 활용 범위
기술·연구 측면에서는 산업 도메인 특화 자동 질의응답, 전문 용어 기반 지식검색, 음성 질의응답 서비스 분야에 활용 가능하며, 기업별 질의응답 데이터베이스를 활용한 검색 정확도 개선에 적용할 수 있습니다. 사업 측면에서는 AI 컨택센터, 고객상담 챗봇, 내부 업무지원·지식검색 서비스로 확장할 수 있습니다.
연구 개발 단계
BM25 희소 임베딩과 KoBERT 기반 크로스 인코더 또는 바이 인코더 밀집 임베딩을 아크탄젠트 스케일링으로 조합하고, 상관 계수 평균과 구동 시간을 측정했습니다. 크로스 인코더와 바이 인코더의 성능 차이는 거의 없었으며, 다양한 산업 도메인의 실제 데이터셋과 서비스 환경에서의 재현성·확장성 검증은 추가로 필요합니다.
- 평가 구성: BM25 희소 임베딩과 KoBERT 기반 크로스 인코더 또는 바이 인코더 밀집 임베딩 조합
- 비교 방식: 크로스 인코더 방식 대비 바이 인코더 방식
- 평가 지표: 스피어맨 상관 계수·피어슨 상관 계수 평균 및 구동 시간
현재 성과
BM25와 KoBERT 기반 바이 인코더의 밀집 임베딩을 아크탄젠트 스케일링으로 조합한 구성에서 스피어맨 상관 계수와 피어슨 상관 계수 평균이 제시되었습니다. 질의와 후보 문장의 문맥 유사도를 반영해 응답 후보의 우선순위를 산출하는 성능 지표입니다.
BM25 희소 임베딩과 KoBERT 기반 바이 인코더 밀집 임베딩을 결합한 응답 획득 방식을 대상으로 구동 시간을 측정했습니다. 동일 평가에서 크로스 인코더 방식과의 성능 및 처리 시간 비교가 수행되었습니다.
BM25 기반 희소 임베딩과 인코더 기반 밀집 임베딩을 각각 아크탄젠트 함수로 스케일링한 뒤 가중합하는 구성이 핵심입니다. 어휘 단위 검색 점수와 문맥 기반 의미 유사도 점수를 함께 반영하고, 낮은 점수에는 페널티가 부여되도록 설계한 점에서 차별성이 있습니다.
상용화까지 남은 부분
산업 도메인별 실제 질의응답 데이터셋에서의 재현성 및 확장성 검증
AI 컨택센터·업무지원 등 서비스 환경에서의 응답 품질, 처리 지연, 동시 요청 대응 성능 검증
도메인 전문 용어와 기업별 지식 데이터에 맞춘 질의응답 데이터베이스 구축 및 운영 기준 마련
기술 이전 형태·도입 과정
도입은 이렇게 진행됩니다.
검토 미팅
귀사 상황·데이터 구조 기준으로 적합성을 논의합니다. 자료 검토만으로 끝나도 됩니다.
PoC 공동 검증
연구팀 동행 하에 귀사 데이터 기준 재학습·성능을 확인합니다.
라이센싱 계약
PoC 결과를 기반으로 희망 형태(실시권·공동연구 등)를 협의합니다.
기술지도·후속
도입 초기 기술지도, 필요 시 후속 공동연구·정부과제 연계까지 진행합니다.
특허 정보
의미 유사도 기반 응답 획득 장치 및 방법
10-2021-0156653 (2021.11.15)
1020230070752 (2023.05.23)
1028286910000 (2025.06.30)
임희석, 이태민, 박정배, 서재형
고려대학교 산학협력단
고려대학교 산학협력단