| 번호 | 청구항 |
|---|---|
| 1 | 오프라인 데이터를 수집하는 오프라인 데이터 수집 단계; 학습 서버의 유효 데이터 추출부가 상기 오프라인 데이터에서 작업 영역 이외의 영역에 해당하는 학습에 불필요한 정보를 제거하고, 상기 작업 영역에 해당하는 오프라인 유효 데이터를 추출하는 오프라인 유효 데이터 추출 단계; 상기 학습 서버의 학습부가 상기 오프라인 유효 데이터를 이용하여 오프라인 강화 학습 모델을 학습하고, 픽셀별 Q-값(Q-value)을 추론하는 오프라인 강화 학습 모델 학습 단계; 상기 학습 서버의 파지 정보 도출부가 로봇 장치가 파지를 수행한 픽셀 좌표를 행동으로 정의하고, 상기 오프라인 유효 데이터에 없는 행동들 중 Q-값이 가장 높은 행동을 대표적인 행동으로 선택하고, 대표적인 행동에만 패널티를 적용하는 패널티 부여 단계; 및 상기 파지 정보 도출부가 상기 패널티가 적용된 행동을 포함하는 픽셀별 Q-값으로부터 파지 대상 물체의 6 자유도 파지 자세를 도출하는 파지 자세 도출 단계를 포함하며, 상기 패널티 부여 단계는 상기 오프라인 강화 학습 모델의 학습에 의해 출력된 Q-값을 가지는 행동들을 상기 오프라인 유효 데이터에 포함되는 행동들과 상기 오프라인 유효 데이터에 포함되지 않는 행동들로 분류하는 오프라인 유효 데이터 포함 판단 단계; 상기 오프라인 유효 데이터에 포함되지 않은 것으로 판단된 행동들 중 최고 Q-값을 갖는 행동인지 확인하는 최고 Q-값 행동 판단 단계; 및 상기 오프라인 유효 데이터에 포함되지 않으며, 최고 Q-값을 갖는 것으로 판단된 행동에 패널티를 부여하는 패널티 부여 단계를 포함하는 로봇의 물체 파지 자세 학습 방법. |
| 2 | 제1 항에 있어서, 상기 파지 자세 도출 단계는 상기 파지 정보 도출부가 상기 패널티가 적용된 행동을 포함하는 픽셀별 Q-값 중 가장 높은 Q-값의 픽셀 좌표를 파지 위치로 설정하고, 좌표 변환을 통해 해당 픽셀 좌표에 대한 상기 6 자유도 파지 자세를 도출하는 로봇의 물체 파지 자세 학습 방법. |
| 3 | 제2 항에 있어서, 상기 오프라인 강화 학습 모델은 합성곱 신경망(Convolution Neural Network)을 포함한 VPG(Visual Pushing and Grasping) 모델 구조이며, 학습 알고리즘은 DQN(Deep Q-Network)과 같은 가치 기반 강화 학습을 사용하는 로봇의 물체 파지 자세 학습 방법. |
| 4 | 제3 항에 있어서, 상기 오프라인 강화 학습 모델의 학습에 의해 출력된 Q-값을 가지는 행동이 상기 오프라인 유효 데이터에 포함되거나, 상기 오프라인 유효 데이터에 포함되지 않은 것으로 판단된 행동들 중 최고 Q-값을 갖는 행동이 아닌 경우, 상기 파지 자세 도출 단계를 진행하는 로봇의 물체 파지 자세 학습 방법. |
| 5 | 제4 항에 있어서, 상기 오프라인 데이터는 튜플(tuple)로 구성되며, 상기 튜플은 색상-깊이 이미지인 현재 상태과, 상기 행동과, 파지 성공 여부인 보상과, 색상-깊이 이미지인 다음 상태를 포함하는 로봇의 물체 파지 자세 학습 방법. |
| 6 | 제5 항에 있어서, 상기 학습 서버는 상기 6 자유도 파지 자세를 상기 로봇 장치로 전달하며, 상기 6 자유도 파지 자세 관련 데이터를 전달받은 상기 로봇 장치가 엔드 이펙트를 제어하여 물체를 파지하는 엔드 이펙터 제어 단계를 더 포함하는 로봇의 물체 파지 자세 학습 방법. |
| 7 | 입력 장치에서 수집된 오프라인 데이터에서 작업 영역 이외의 영역에 해당하는 학습에 불필요한 정보를 제거하고, 상기 작업 영역에 해당하는 오프라인 유효 데이터를 추출하는 유효 데이터 추출부; 상기 오프라인 유효 데이터를 오프라인 강화 학습 모델을 이용하여 학습하고, 픽셀별 Q-값(Q-value)을 추론하는 학습부; 및 상기 픽셀별 Q-값(Q-value)으로부터 파지 대상 물체의 6 자유도 파지 자세를 도출하는 파지 정보 도출부를 포함하며, 상기 파지 정보 도출부는 로봇 장치가 파지를 수행한 픽셀 좌표를 행동으로 정의하고, 상기 오프라인 강화 학습 모델의 학습에 의해 출력된 Q-값을 가지는 행동들을 상기 오프라인 유효 데이터에 포함되는 행동들과 상기 오프라인 유효 데이터에 포함되지 않는 행동들로 분류하며, 상기 오프라인 유효 데이터에 없는 행동들 중 Q-값이 가장 높은 행동을 대표적인 행동으로 선택하고, 대표적인 행동에만 패널티를 적용하는 로봇의 물체 파지 자세 학습 서버. |
| 8 | 제7 항에 있어서, 상기 파지 정보 도출부는 상기 오프라인 강화 학습 모델의 학습에 의해 출력된 Q-값을 가지는 행동이 상기 오프라인 유효 데이터에 포함되는지 판단하고, 상기 오프라인 유효 데이터에 포함되지 않은 것으로 판단된 행동들 중 최고 Q-값을 갖는 행동인지 확인한 후, 상기 오프라인 유효 데이터에 포함되지 않으며, 최고 Q-값을 갖는 것으로 판단된 행동에 패널티를 부여하는 로봇의 물체 파지 자세 학습 서버. |
| 9 | 제8 항에 있어서, 상기 파지 정보 도출부는 상기 패널티가 적용된 행동을 포함하는 픽셀별 Q-값 중 가장 높은 Q-값의 픽셀 좌표를 파지 위치로 설정하고, 좌표 변환을 통해 해당 픽셀 좌표에 대한 상기 6 자유도 파지 자세를 도출하는 로봇의 물체 파지 자세 학습 서버. |
| 10 | 제9 항에 있어서, 상기 오프라인 데이터는 튜플(tuple)로 구성되며, 상기 튜플은 색상-깊이 이미지인 현재 상태과, 상기 행동과, 파지 성공 여부인 보상과, 색상-깊이 이미지인 다음 상태를 포함하는 로봇의 물체 파지 자세 학습 서버. |
| 11 | 제10 항에 있어서, 상기 오프라인 데이터, 상기 오프라인 유효 데이터, 상기 학습부의 학습 결과에 의해 출력된 상기 픽셀별 Q-값(Q-value) 및 상기 6 자유도 파지 자세를 저장하는 데이터 베이스부를 더 포함하는 로봇의 물체 파지 자세 학습 서버. |
| 12 | 대량의 오프라인 데이터를 수집하는 입력 장치; 및 상기 오프라인 데이터를 이용하여 6 자유도 파지 자세를 도출하는 제7 항 내지 제11 항 중 하나의 로봇의 물체 파지 자세 학습 서버를 포함하는 로봇의 물체 파지 자세 학습 시스템. |
| 13 | 제12 항에 있어서, 상기 로봇의 물체 파지 자세 학습 서버는 상기 6 자유도 파지 자세는 로봇 장치로 전달하며, 상기 로봇 장치는 상기 6 자유도 파지 자세를 이용하여 엔드 이펙터를 제어하는 로봇의 물체 파지 자세 학습 시스템. |
| 14 | 제12 항에 있어서, 상기 입력 장치는 3차원 레이저 스캐너, 카메라 및 3차원 센서 중 적어도 하나로 구성되는 로봇의 물체 파지 자세 학습 시스템. |