실세계의 특성을 면밀히 반영하는 정보성 3-D 아바타는 메타버스에 접근하는 데 있어 핵심적인 역할을 한다. 전통적인 3-D 아바타 생성 방법은 대개 일대일(one-to-one) 학습을 사용하는데, 이는 아바타의 다양성을 제한한다. 생성된 3-D 아바타의 스타일 다양성을 향상시키기 위해, 우리는 ChatGPT로부터 대화형 방식의 프롬프트를 받아 유도된 합성 이미지(synthesized images)를 활용하며, 그 결과 3-D 변형의 범위가 더 넓어지도록 한다. 처음부터 모델을 구축하는 대신, 우리는 기존의 대규모 파운데이션 모델을 활용하는 학습 불필요(training-free) 프레임워크를 고안한다. 구체적으로, 우리는 ChatGPT가 대화형 방식으로 생성한 텍스트 프롬프트에 의해 안내되는 실세계 이미지 합성 기법을 사용하여, 합성 이미지에 원하는 특성을 기술한다. 그 결과, 이러한 정보성 잠재 표현(latent representations)은 합성 이미지의 고유한 스타일을 정확하게 반영할 수 있으며, 나아가 광실감(photorealistic)과 다양성을 갖춘 3D 아바타 생성을 가능하게 한다. 본 연구의 학습 불필요 설계는 최소한의 계산 자원만을 필요로 하면서도, 기존 생성 모델들과 비교할 때 경쟁력 있는 성능을 달성할 수 있게 한다.
*본 초록은 AI를 통해 원문을 번역한 내용입니다. 정확한 내용은 하기 원문에서 확인해주세요.