| 번호 | 청구항 |
|---|---|
| 7 | 제6 항에 있어서,상기 유사 캡션 중 미리 정해진 개수의 선택 캡션을 결정하는 단계는,복수의 상기 유사 캡션 중 두개의 유사 캡션을 임의로 추출하여 상기 선택 캡션으로 결정하는 단계를 포함하는 이미지 캡션 생성 방법. |
| 8 | 제6 항에 있어서,상기 선택 캡션에 기초하여 상기 보강 캡션을 생성하는 단계는,상기 대상 이미지, 상기 선택 캡션 및 미리 정의된 생성 알고리즘에 기초하여 상기 보강 캡션을 생성하는 단계를 포함하는이미지 캡션 생성 방법. |
| 9 | 제8 항에 있어서,상기 생성 알고리즘은, LVLM(Large Vision-Language Model)에 기초한 알고리즘을 포함하는이미지 캡션 생성 방법. |
| 1 | 이미지 캡션(Image Caption) 생성 장치에 의해 수행되는 이미지 캡션 생성 방법에 있어서, 대상 이미지를 제공받는 (a) 단계;상기 대상 이미지 및 상기 대상 이미지에 대한 이미지 캡션인 대상 캡션을 기초로 상기 대상 이미지에 대한 유사 이미지를 판단하는 (b) 단계;상기 유사 이미지에 대한 상기 이미지 캡션인 유사 캡션에 기초하여 상기 대상 이미지에 대한 보강 캡션을 생성하는 (c) 단계;상기 보강 캡션을 상기 대상 캡션에 추가하는 (d) 단계; 및상기 (b) 단계 내지 상기 (d) 단계를 반복하여 수행하는 (e) 단계를 포함하는이미지 캡션 생성 방법. |
| 2 | 제1 항에 있어서,상기 (b) 단계는,미리 정의된 식별 알고리즘에 기초하여 대상 이미지에 대한 유사 이미지를 식별하는 단계를 포함하는이미지 캡션 생성 방법. |
| 3 | 제2 항에 있어서,상기 식별 알고리즘은, VLM(Vision-Language Model)에 기초한 알고리즘을 포함하고,상기 VLM은 CLIP(Contrastive Language-Image Pre-training) 모델을 포함하는이미지 캡션 생성 방법. |
| 4 | 제2 항에 있어서,상기 식별 알고리즘은, 텍스트 임베딩부와 이미지 임베딩부를 포함하고,상기 식별 알고리즘에 기초하여 대상 이미지에 대한 유사 이미지를 식별하는 단계는,상기 대상 캡션을 상기 텍스트 임베딩부에 입력함으로써 텍스트 임베딩을 생성하는 단계와,상기 텍스트 임베딩과 미리 저장된 복수의 비교 이미지 사이의 유사도에 기초하여 상기 유사 이미지를 식별하는 단계를 포함하는이미지 캡션 생성 방법. |
| 5 | 제4 항에 있어서,상기 텍스트 임베딩과 미리 저장된 복수의 비교 이미지 사이의 유사도에 기초하여 상기 유사 이미지를 식별하는 단계는,상기 복수의 비교 이미지 각각을 상기 이미지 임베딩부에 입력함으로써 복수의 이미지 임베딩을 생성하는 단계와,상기 텍스트 임베딩 및 상기 이미지 임베딩 사이의 코사인 유사도(Cosine Similarity)에 기초하여 상기 유사 이미지를 식별하는 단계를 포함하는이미지 캡션 생성 방법. |
| 6 | 제1 항에 있어서,상기 (c) 단계는, 상기 유사 캡션 중 미리 정해진 개수의 선택 캡션을 결정하는 단계와,상기 선택 캡션에 기초하여 상기 보강 캡션을 생성하는 단계를 포함하는이미지 캡션 생성 방법. |
| 10 | 제9 항에 있어서,상기 대상 이미지, 상기 선택 캡션 및 미리 정의된 생성 알고리즘에 기초하여 상기 보강 캡션을 생성하는 단계는,상기 대상 이미지, 상기 선택 캡션, 상기 대상 이미지와 상기 선택 캡션 사이의 시각적 구별을 요청하는 요청 데이터를 상기 생성 알고리즘에 입력함으로써 상기 보강 캡션을 생성하는 단계를 포함하는이미지 캡션 생성 방법. |