연구 영역
기본 정보
논문·특허
과제
구성원
읽는 시간 · 1분 12초

LLM·VLM 기반 로봇 지능과 강화학습 보상함수 생성

LLM/VLM-driven Robot Intelligence and Reinforcement Learning Reward Function Generation

연구 내용

LLM·VLM을 활용해 로봇의 계획·실행 일반화 성능을 높이고, 강화학습에서 보상함수 생성 성공률을 프롬프팅 기반으로 개선하는 연구

LLM과 VLM의 기초 모델을 로봇 지능 구성 요소에 적용하여 고수준 계획과 장면 이해 능력을 보강하는 연구를 수행합니다. 멀티모달 입력을 통해 시각 맥락과 언어 기반 명령을 결합하고, 로봇 행동 정책으로 연결하는 방식을 정리합니다. 또한 강화학습에서 보상함수 설계 자동화를 목표로, Small Language Model에 In-Context Learning과 Chain-of-Thought prompting을 적용해 보상함수 생성의 성공률 변화를 평가하고 개선 조건을 도출합니다. 이를 통해 실환경에서의 적응성 확보를 위한 모델-정책 연계를 지향합니다.

관련 연구 성과

관련 논문

2

관련 특허

0

관련 프로젝트

1

연구 흐름

초기에는 LLM·VLM이 로봇 지능의 계획·실행, 조작, 장면 이해 전반에서 어떻게 활용되는지 정리하고, 강화학습 보상 설계와 저수준 제어, 고수준 계획 간 연결 구조를 구분했습니다. 이후 2024년에는 보상함수 생성 작업을 대상으로 Small Language Model에 ICL과 CoT 프롬프팅을 적용하여 성공률 유지 및 조건을 실험적으로 확인했습니다. 동시에 2024년부터 진행 중인 메타-휴머노이드 Adroid4X 과제를 통해 하이퍼모달 인지능력과 역할 다양성 기반의 정책 학습 방향을 확장하고 있습니다. 현재는 로봇 강화학습 구성요소를 프롬프팅 전략과 연계하는 연구 흐름을 이어가고 있습니다.

활용 가능성

활용 가능성은 알앤디써클 특화 AI 에이전트가 생성한 내용으로, 실제 연구 가능 여부는 연구실과의 논의가 필요합니다.

  • LLM 기반 로봇 행동 계획
  • VLM 기반 장면 이해
  • 강화학습 보상함수 자동 생성
  • ICL·CoT 기반 SLM 프롬프팅 최적화
  • Edge 디바이스형 로봇 지능
  • 멀티모달 로봇 정책 연결
  • 메타 어포던스 학습
  • 역할 다양성 기반 협업 로봇
  • 휴먼 명령 기반 로봇 실행
  • 보상 설계 오류 저감 전략

관련 논문

구분

제목

1

A Survey of Robot Intelligence with Large Language Models

2

A Study on the Effects of ICL and CoT Prompts on the Reward Function Generation of a Small Language Model

관련 프로젝트

구분

제목

1

하이퍼모달 인지능력 및 역할다양성을 소유한 메타-휴머노이드: Adroid4X