연구 영역
기본 정보
논문·특허
과제
구성원
Article|
인용수 0
·2025
Prompting and Fine-Tuning Large Language Models for Parkinson Disease Diagnosis: Comparative Evaluation Study Using the PPMI Structured Dataset (Preprint)
Hyun-Ji Shin, Young Jin Jeong, So Yun Jun, Do-Young Kang
초록

배경 파킨슨병(PD)은 운동 및 비운동 증상의 이질성으로 인해 진단에 어려움이 있다. 전통적인 머신러닝(ML) 접근법은 구조화된 임상 변수에 기반한 방법으로 평가되어 왔다. 그러나 구조화된 임상 데이터를 자연어 표현으로 활용하는 대규모 언어모델(LLM)이 진단에 제공하는 유용성은 충분히 탐구되지 않았다. 목적 본 연구는 구조화된 임상 데이터에서 유래한 자연어 프롬프트를 활용하여 여러 LLM의 진단 분류 성능을 평가하고, 이를 전통적인 ML 기준모형과 비교하고자 하였다. 방법 우리는 파킨슨병 진행 마커 이니셔티브(Parkinson’s Progression Markers Initiative, PPMI) 데이터셋의 구조화된 임상 변수를 자연어 프롬프트로 재구성한 뒤, 이를 여러 LLM의 입력으로 사용하였다. 다중공선성이 높은 변수는 제거하였고, Shapley additive explanations(SHAP) 기반 특성 순위화로 상위 10개 특징을 선택하였다. LLM 성능은 몇-샷 프롬프팅, 추가적으로 사후(後) 설명 텍스트를 생성하는 이중 출력(dual-output) 프롬프팅(탐색적 구성요소), 그리고 지도학습 기반 미세조정(supervised fine-tuning) 전반에 걸쳐 검토하였다. 로지스틱 회귀(LR)와 서포트 벡터 머신(SVM) 분류기는 ML 기준모형으로 사용하였다. 모델 성능은 테스트 세트와 제한된 크기의 시간적으로 독립적인 검증 세트(temporal validation set)에서 <i>F</i><sub>1</sub>-점수를 이용해 평가하였으며, 안정성(stability)을 확인하기 위해 반복적인 출력 생성(repeated output generation)을 수행하였다. 결과 122명의 참가자로 구성된 테스트 세트에서, SHAP로 선택된 10개 임상 변수를 각각 사용해 학습한 LR과 SVM은 모두 거시평균 <i>F</i><sub>1</sub>-점수 0.960(정확도 0.975)을 달성하였다. 동일한 변수에서 유래한 자연어 프롬프트를 받은 LLM들은 이에 상응하는 성능을 보였으며, 최우수의 몇-샷 구성은 거시평균 <i>F</i><sub>1</sub>-점수 0.987(정확도 0.992)을 달성하였다. 31명의 참가자로 구성된 시간적 검증 세트에서 LR은 거시평균 <i>F</i><sub>1</sub>-점수 0.903을 유지한 반면, SVM은 상당한 성능 저하를 보였다. 반면, 여러 LLM은 높은 진단 성능을 지속하여 거시평균 <i>F</i><sub>1</sub>-점수 최대 0.968에 도달하였고, PD에 대한 높은 재현율(recall)을 나타냈다. LLM 조건 전반에서 반복적인 출력 생성은 전반적으로 안정적인 예측을 산출하였으며, 실행 간(run)에는 드문 변동만 관찰되었다. 이중 출력 프롬프팅에서는 몇-샷 프롬프팅에 비해 진단 성능이 감소하는 양상을 보였으나, 전반적으로는 안정적으로 유지되었다. 경량(lightweight) 모델에 대한 지도학습 기반 미세조정은 안정성을 향상시켰고, GPT-4o-mini는 테스트 세트에서 거시평균 <i>F</i><sub>1</sub>-점수 0.987을 달성하였으며, 소규모 시간적 검증 세트에서는 전반적으로 일관되게 올바른 예측이 관찰되었다. 다만 이는 표본 크기가 제한되어 있고 평가가 탐색적 성격을 띠므로 신중하게 해석되어야 한다. 결론 본 연구는 구조화된 임상 변수를 자연어 형태로 제시할 때 현대 LLM이 이를 어떻게 처리하는지에 대한 탐색적 벤치마크를 제공한다. 일부 모델은 테스트 세트와 시간적 검증 세트 모두에서 LR과 견줄 만한 진단 성능을 달성했지만, 출력은 프롬프트 형식, 모델 선택, 그리고 클래스 분포에 민감하였다. 반복적인 출력 생성에서 나타난 간헐적 변동은 LLM의 확률적(stochastic) 특성을 반영하였고, 경량 모델은 안정적인 일반화를 위해 지도학습 기반 미세조정이 필요하였다. 이러한 결과는 표 형태(tabular) 임상 정보를 처리하는 현재 LLM의 역량과 한계를 보여주며, 신중한 적용과 추가 연구의 필요성을 강조한다.

*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.

키워드
Support vector machineInterpretabilityMulticollinearityLogistic regressionSet (abstract data type)Natural languageTest setTest (biology)Random forestFeature (linguistics)
타입
Article
IF / 인용수
- / 0
게재 연도
2025