배경 의료 데이터의 효과적인 2차 활용은 이질적인 지역 용어로 인해 단편화되고 의미론적 상호운용성이 부족하여 저해된다. 임상 용어를 SNOMED CT(Systematized Nomenclature of Medicine Clinical Terms)로 표준화하는 것은 필수이지만, 특히 여러 기관에 걸쳐서는 여전히 수작업에 의존하는 노동 집약적이고 일관성이 낮은 과정으로 남아 있다. 신뢰할 수 있는 매핑과 대규모 연구를 위한 새로운 개념 저작을 지원할 수 있는 자동화되고 확장 가능한 솔루션이 필요하다. 목적 본 연구는 다기관 임상 데이터셋 전반에서 원활하고 표준화된 데이터 통합을 가능하게 하는 SNOMED CT 용어 매핑 및 개념 저작을 간소화하는 대규모 언어 모델(LLM) 보조 도구를 개발하고자 하였다. 방법 매핑 파이프라인은 지역 용어 전처리, 구문 및 LLM 기반 벡터 유사도 매핑, 그리고 검증된 결과에 기반한 반복적 정제를 포함하였다. 번역과 의미 표현에는 GPT-4o(OpenAI)를 사용하였다. 새로운 개념은 구조화된 후지시(postcoordination) 과정으로 저작하였으며, 저작의 효율성과 품질(중복률 및 Machine Readable Concept Model 검증 위반 포함)을 정량적으로 평가하였다. 성능 평가는 한국의 4개 주요 병원 네트워크(9개 대학병원)에서 진단 및 수술 절차 용어를 사용하여 수행하였고, 임상 용어사(terminologists)로부터 추가적인 사용성 피드백을 수집하였다. 결과 기준 용어를 사용했을 때 진단 매핑의 top-5 정확도는 4개 기관에서 각각 98.7%, 89.7%, 98.5%, 92.8%에 도달하였으며, 수술 절차 매핑은 99.2%, 82.6%, 98.7%, 84.7%였다. 이 도구의 구현은 수작업 매핑 비율을 30% 감소시켰고, 전체 수작업 부담은 최대 90%까지 감소시켰다. 제안한 도구는 평균 매핑 및 새로운 개념 생성 시간을 약 75% 감소시켰고, 최종 매핑 테이블 처리 시간은 90% 감소시켰다. 새로운 개념 저작 오류 또한 감소하였으며, 중복 개념은 83% 감소, 모델링 규칙 위반은 72% 감소하였다. 결론 본 연구는 효율성, 매핑 정확도 및 새로운 개념의 품질을 유의하게 개선하는 자동화된 LLM 보조 SNOMED CT 매핑 도구를 개발하고 검증하였다. 한계로는 기술적 통합의 어려움과 번역 품질에 대한 의존성이 포함된다. 향후 방향은 SNOMED CT의 온톨로지 구조 및 지식 그래프를 활용하고, 지속적인 유지보수와 품질 보증을 통해 지속가능성을 강화하며, Machine Readable Concept Model 규칙 집행 및 비활성화 프로세스를 자동화하여 견고하고 확장 가능한 용어 표준화를 달성하도록 새로운 개념 저작을 추가로 발전시키는 것이다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.