FAQ 검색 시스템은 정보 검색 분야의 하나로, 사용자 질의로부터 적절한 질문-답변 쌍을 검색하는 작업을 수행한다. 최근 연구에서는 질의-질문 유사성과 질의-답변 관계를 각각 밀집 표현(dense representations)을 사용하여 심층 학습 모델을 별도로 학습하였다. 그러나 질문-답변 쌍의 문장에는 서로 다른 정보가 포함될 수 있으므로, 사용자의 질의에 대한 유사도를 측정할 때 두 문장을 동시에 활용하면 검색 성능을 향상시킬 수 있다. 본 논문에서는 단일 인코더를 사용하여 질의와 질문-답변 쌍 간의 관계를 학습함으로써 검색 성능을 개선할 수 있는 학습 방법을 제안한다. 우리는 StackFAQ 데이터셋에서 인간이 라벨링한 질의를 사용하여 P@5, MAP, MRR 성능을 평가하였다. 성능이 학습 방법의 개선을 통해 향상될 수 있음을 보이기 위해, 이전 연구와 동일한 모델 및 GPT-2로 생성한 동일한 질의 데이터셋을 사용하여 학습하고 검증하였다. 더 나아가 GPT-3.5로 생성한 질의를 사용해 학습하면 성능을 추가로 향상시킬 수 있음을 보였다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.