특성 수준 주석(annotations)이 포함된 에세이 피드백 데이터셋의 제한된 가용성으로 인해, 에세이 평가 연구는 주로 자동화 에세이 채점(AES) 또는 피드백 생성에 초점을 맞춰 왔다. 본 논문에서는 Learner’s Essay and Feedback (LEAF) 데이터셋의 확장인 LEAF++를 제안하며, 원래의 피드백과 함께 특성 수준 점수(trait-level scores)를 추가로 풍부하게 포함한다. 이러한 특성 점수는 에세이의 세부 요소를 정밀하게 분석할 수 있게 하며, 피드백과의 관계를 검증할 수 있는 근거를 제공한다. 데이터셋을 평가하기 위해, 우리는 LLM 기반의 4가지 검증 접근법을 제안한다. Score2Feedback은 특성 점수가 LLM이 참조(reference) 피드백과 유사한 피드백을 생성하도록 안내하는지 여부를 검토한다. Feedback2Score는 참조 피드백을 사용하여 에세이를 수정(revise)할 경우 특성 점수가 향상되는지를 평가한다. FeedbackviaReference는 특성 점수에 의해 안내되면서, 피드백이 참조와의 최소 유사도 기준을 만족할 때까지 참조를 바탕으로 피드백을 반복적으로 정교화한다. FeedbackviaScore는 수정된 에세이가 원래 에세이보다 더 높은 점수를 얻을 때까지, 점수에 기반하여 피드백을 반복적으로 수정한다. 이러한 전략을 통해 우리는 피드백 생성 및 에세이 수정에 대한 영향도를 측정함으로써 특성 점수를 검증하고, 특성 수준 점수와 이에 대응하는 피드백 간의 관계를 부각한다. 프롬프팅(LLaMA-3, Mistral, Falcon-3, Phi-3)과 파인튜닝(LLaMA-3, Mistral, GPT-OSS)을 사용한 실험 결과, 특성 점수는 LLM이 의미 있는 피드백을 생성하도록 효과적으로 안내하는 것으로 나타났다. 또한 결과는 주석된 특성 점수가 해당 에세이 피드백과 유의미하게 관련됨을 보여준다. LEAF++ Dataset: https://github.com/misgna/LEAF-plusplus.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.