연구 영역
기본 정보
논문·특허
과제
구성원
Article|
인용수 0
·2026
Prompting and Fine-Tuning Large Language Models for Parkinson Disease Diagnosis: Comparative Evaluation Study Using the PPMI Structured Dataset
Hyun-Ji Shin, Young Jin Jeong, So Yun Jun, Do-Young Kang
IF 3.8 (2026) JMIR Medical Informatics
초록

배경: 파킨슨병(PD)은 운동 및 비운동 양상이 이질적이어서 진단에 어려움이 있다. 전통적인 머신러닝(ML) 접근법은 구조화된 임상 변수를 대상으로 평가되어 왔다. 그러나 구조화된 임상 데이터를 자연어 표현으로 활용하는 대규모 언어모델(LLM)의 진단적 유용성은 충분히 탐구되지 않았다. 목적: 본 연구는 구조화된 임상 데이터로부터 도출한 자연어 프롬프트를 사용하여 다수의 LLM에 대한 진단 분류 성능을 평가하고, 그 성능을 전통적인 ML 기준선과 비교하고자 했다. 방법: 제한된 크기의 테스트 세트와 시간적으로 독립적인 검증 세트(시간 검증 세트)에서의 -점수에 대한 평가를 수행하였으며, 안정성을 평가하기 위해 반복적인 출력 생성을 실시하였다. 결과: 테스트 세트에서 -점수 0.987을 보였고, 소규모 시간 검증 세트에서는 일관되게 정확한 예측이 관찰되었으나, 제한된 표본 수와 탐색적 성격의 평가를 고려하여 신중하게 해석해야 한다. 결론: 본 연구는 현대 LLM이 자연어 형태의 구조화된 임상 변수를 어떻게 처리하는지에 대한 탐색적 벤치마크를 제공한다. 일부 모델은 테스트 데이터 및 시간 검증 데이터 모두에서 LR과 유사한 수준의 진단 성능을 달성했지만, 그 출력은 프롬프트 형식, 모델 선택, 그리고 범주 분포에 민감하게 반응했다. 반복 출력 생성에서 관찰된 간헐적인 변동성은 LLM의 확률적(스토캐스틱) 특성을 반영했으며, 경량 모델은 안정적인 일반화를 위해 지도 학습 기반의 미세조정(supervised fine-tuning)이 필요했다. 이러한 결과는 표 형태의 임상 정보를 처리하는 현행 LLM의 역량과 한계를 보여주며, 신중한 적용과 추가 연구의 필요성을 강조한다.

*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.

키워드
Benchmark (surveying)Class (philosophy)Language modelTest (biology)Process (computing)Natural languageDisease
타입
Article
IF / 인용수
3.8 / 0
게재 연도
2026