강화 학습 기반의 상호작용 향상 방식
SCHEME FOR REINFORCEMENT LEARNING BASED ENHANCEMENT OF INTERACTION
특허 요약
강화 학습(Reinforcement Learning: RL)을 사용하여 교육용 과제를 추천하는 방법이 제공된다. 개시된 방법은, 학생의 교육을 위한 다수의 과제로부터의 반복되는 택일을 위한 알고리즘의 매 라운드에서, 다수의 과제 각각의 선택 확률을 설정하는 것과, 설정된 선택 확률에 따라 다수의 과제 중 하나를 추천되는 과제로서 선택하는 것과, 학생의 주어진 역량 수준에서 선택된 과제의 요구되는 기량 수준 및 추정된 기량 수준을 비교하는 것과, 비교의 결과로부터 보상을 산출하고, 보상에 기반하여 추정된 기량 수준을 갱신하는 것과, 선택된 과제의 설정된 선택 확률 및 산출된 보상에 기반하여 상기 선택된 과제의 보상 추정치를 설정하는 것과, 보상 추정치를 사용하여, 선택된 과제가 다음에 선택될 확률의 감소를 방지하는 것을 포함하는 동작을 수행하는 단계를 포함한다.
청구항
번호청구항
1

강화 학습(Reinforcement Learning: RL)을 사용하여 교육용 과제를 추천하는 컴퓨팅 장치로서,프로세서와,프로세서 실행가능 명령어가 저장된 메모리를 포함하되, 상기 프로세서 실행가능 명령어는 상기 프로세서에 의해 실행되는 경우 상기 프로세서로 하여금, 학생의 교육을 위한 다수의 과제로부터의 반복되는 택일을 위한 알고리즘의 매 라운드에서 동작을 수행하게 하되, 상기 알고리즘은 적대적 밴딧(adversarial bandit) 설정에서의 상기 RL의 사용을 위한 Exp3 알고리즘(Exponential-weight algorithm for Exploration and Exploitation)이고, 상기 동작은,상기 다수의 과제 각각의 선택 확률을 설정하는 것 - 상기 각각의 과제의 상기 선택 확률은 미선택된 과제의 탐색(exploration)을 가능하게 하는 균일 분포, 기선택된 과제의 이용(exploitation)을 가능하게 하는 가중 분포, 그리고 상기 탐색 및 상기 이용의 트레이드오프(tradeoff) 관계를 나타내는 파라미터에 기반하여 설정됨 - 과,상기 설정된 선택 확률에 따라 상기 다수의 과제 중 하나를 추천되는 과제로서 선택하는 것과,상기 선택된 과제의 요구되는 기량 수준 및 추정된 기량 수준을 비교하는 것과,상기 비교의 결과로부터 보상(reward)을 산출하는 것과,상기 산출된 보상에 기반하여 상기 추정된 기량 수준을 갱신하는 것과,상기 선택된 과제의 상기 설정된 선택 확률 및 상기 산출된 보상에 기반하여 상기 선택된 과제의 보상 추정치를 설정하는 것과,상기 보상 추정치를 사용하여 특정한 가중치를 상기 알고리즘의 다음 라운드에서의 상기 선택 확률의 설정을 위해 갱신하는 것 - 상기 특정한 가중치는 상기 선택된 과제가 상기 가중 분포에 따라 이용될 확률을 정의하는 데에 사용되고, 상기 특정한 가중치를 갱신하는 것은 상기 특정한 가중치에 지수 항을 곱하는 것을 포함하되, 상기 지수 항의 지수에 상기 보상 추정치가 사용됨 - 을 포함하는,컴퓨팅 장치.

2

삭제

3

삭제

4

제1항에 있어서,상기 보상은 상기 선택된 과제에 대한 상기 학생의 답이 정답인지 또는 오답인지에 따라 상이하게 상기 비교의 상기 결과로부터 산출되는,컴퓨팅 장치.

5

제1항에 있어서,상기 보상은 상기 선택된 과제에 대한 상기 학생의 답이 정답인 경우, 상기 요구되는 기량 수준이 상기 추정된 기량 수준보다 클수록 더 커지게 산출되거나, 상기 보상은 상기 선택된 과제에 대한 상기 학생의 답이 오답인 경우, 상기 요구되는 기량 수준이 상기 추정된 기량 수준보다 작을수록 더 작아지게 산출되거나, 양자 모두인,컴퓨팅 장치.

6

강화 학습(Reinforcement Learning: RL)을 사용하여 교육용 과제를 추천하는 컴퓨팅 장치에 의해 수행되는 방법으로서,학생의 교육을 위한 다수의 과제로부터의 반복되는 택일을 위한 알고리즘의 매 라운드에서 동작을 수행하는 단계를 포함하되, 상기 알고리즘은 적대적 밴딧(adversarial bandit) 설정에서의 상기 RL의 사용을 위한 Exp3 알고리즘(Exponential-weight algorithm for Exploration and Exploitation)이고, 상기 동작은,상기 다수의 과제 각각의 선택 확률을 설정하는 것 - 상기 각각의 과제의 상기 선택 확률은 미선택된 과제의 탐색(exploration)을 가능하게 하는 균일 분포, 기선택된 과제의 이용(exploitation)을 가능하게 하는 가중 분포, 그리고 상기 탐색 및 상기 이용의 트레이드오프(tradeoff) 관계를 나타내는 파라미터에 기반하여 설정됨 - 과,상기 설정된 선택 확률에 따라 상기 다수의 과제 중 하나를 추천되는 과제로서 선택하는 것과,상기 선택된 과제의 요구되는 기량 수준 및 추정된 기량 수준을 비교하는 것과,상기 비교의 결과로부터 보상을 산출하는 것과,상기 산출된 보상에 기반하여 상기 추정된 기량 수준을 갱신하는 것과,상기 선택된 과제의 상기 설정된 선택 확률 및 상기 산출된 보상에 기반하여 상기 선택된 과제의 보상 추정치를 설정하는 것과,상기 보상 추정치를 사용하여 특정한 가중치를 상기 알고리즘의 다음 라운드에서의 상기 선택 확률의 설정을 위해 갱신하는 것 - 상기 특정한 가중치는 상기 선택된 과제가 상기 가중 분포에 따라 이용될 확률을 정의하는 데에 사용되고, 상기 특정한 가중치를 갱신하는 것은 상기 특정한 가중치에 지수 항을 곱하는 것을 포함하되, 상기 지수 항의 지수에 상기 보상 추정치가 사용됨 - 을 포함하는,방법.

7

삭제

8

삭제

9

제6항에 있어서,상기 보상은 상기 선택된 과제에 대한 상기 학생의 답이 정답인지 또는 오답인지에 따라 상이하게 상기 비교의 상기 결과로부터 산출되는,방법.

10

제6항에 있어서,상기 보상은 상기 선택된 과제에 대한 상기 학생의 답이 정답인 경우, 상기 요구되는 기량 수준이 상기 추정된 기량 수준보다 클수록 더 커지게 산출되거나,상기 보상은 상기 선택된 과제에 대한 상기 학생의 답이 오답인 경우, 상기 요구되는 기량 수준이 상기 추정된 기량 수준보다 작을수록 더 작아지게 산출되거나,양자 모두인,방법.

11

컴퓨터 프로세서에 의해 실행되는 경우 상기 컴퓨터 프로세서로 하여금 제6항, 제9항 및 제10항 중 어느 한 항에 기재된 방법을 수행하게 하는 컴퓨터 실행가능 명령어가 저장된 컴퓨터 판독가능 저장 매체.