본 연구는 로봇 강화학습에서 핵심 과제인 보상 함수 생성의 성공률을 향상시키기 위한 방법을 탐구하고자, 소언어모델(Small Language Model, SLM)에 In-Context Learning(ICL) 및 Chain-of-Thought(CoT) 프롬프팅 기법을 적용하였다. 기존의 보상 함수 생성 프레임워크인 Eureka는 OpenAI의 대규모 언어모델 GPT-4를 사용하였으나, 본 연구는 에지 디바이스에 구현할 수 있는 LLaMA3 8B 모델을 사용하여 보상 함수를 생성하는 데 초점을 맞추었다. 실험 결과, CoT 기법만으로는 성능 향상에 충분하지 않았다. 그러나 ICL 기법을 적용했을 때 부분적인 개선이 관찰되었다. 특히, ICL과 CoT 프롬프팅 기법을 결합하면 cartpole 및 ball balance 두 과제 모두에서 보상 함수 생성의 성공률을 일관되게 유지하였다. 이는 두 기법의 상보적 효과로 해석될 수 있는데, ICL 기법이 보상 함수 생성과 관련된 맥락을 모델에 제공하는 한편, CoT 기법은 단계별 추론을 통해 복잡한 문제의 해결을 용이하게 하기 때문이다. 따라서 SLM 기반 보상 함수 생성의 성능 향상을 위해 다양한 프롬프팅 기법을 통합하는 것이 중요하다고 결론지었다. 향후 연구는 통계적으로 유의미한 결과를 도출하기 위해 실험 표본 수를 늘리는 것, 오류를 줄이기 위해 CoT와 함께 ICL 일반화 방법을 정교화하는 것, 그리고 최적 전략을 찾기 위해 다양한 프롬프팅 기법을 적용하는 데 초점을 맞춰야 한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.