최근 대규모 언어 모델(Large Language Models, LLM)의 발전은 문서 AI(Document AI) 분야를 크게 향상시켰으며, 질의응답(question answering)과 같은 문서 이해 작업에서 두드러진 성능을 보여주었다. 그러나 기존 접근은 주로 특정 과제를 해결하는 데 초점이 맞추어져 있어, 문서 정보를 구조적으로 조직하고 관리할 수 있는 기능이 부족하다. 이러한 한계를 해결하기 위해, 우리는 문자, 단어, 구조 수준에서 발생하는 OCR 오류를 체계적으로 교정하는 프레임워크 REVISE를 제안한다. 구체적으로 REVISE는 일반적인 OCR 오류에 대한 포괄적인 계층적 분류 체계를 활용하며, 그러한 오류를 현실적으로 모사하는 합성 데이터 생성 전략을 통해 효과적인 교정 모델을 학습한다. 실험 결과는 REVISE가 OCR 출력을 효과적으로 교정함으로써, 문서 내용의 보다 구조화된 표현과 체계적인 관리를 가능하게 함을 보여준다. 그 결과, 본 방법은 문서 검색 및 질의응답 과제에서 하류 성능을 유의미하게 향상시키며, 기존 문서 AI 프레임워크의 구조적 관리 한계를 극복할 가능성을 시사한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.