문장으로부터 4차원 인간을 생성하는 문제는 메타버스 및 가상현실과 같은 다양한 응용 분야에서 중요한 주제로 인식된다. 그러나 기존의 Text-to-4D 생성 방법들은 외형과 동작을 동시에 생성하는 방식을 주로 사용하고 이는 제어 가능성 저하와 높은 비용의 한계를 가진다. 본 논문에서는 외형과 동작을 분리하여 생성한 뒤 이를 통합하는 텍스트 기반의 4차원 인간 생성 파이프라인을 제안한다. 먼저 주어진 외형, 동작 문장으로부터 Stable Diffusion으로 인간의 외형 이미지를 생성하고, Motion Diffusion Model로 동작을 생성한다. 이후 MusePose로 외형과 동작을 결합한 정면 시점 비디오를 생성하고, SV4D를 통해 다시점 비디오로 확장한 뒤, Grid4D를 통해 4차원 표현을 학습한다. 제안한 파이프라인의 검증을 위해 4차원 인간 생성용 데이터 세트를 구축하고, 렌더링 비디오에 정량적, 정성적 평가를 수행하였다. 실험 결과, 제안한 방법은 77.5% Dynamic Degree, 58.3%의 Aesthetic Quality, 그리고 24.8%의 Overall Consistency를 나타내 일부 지표에서 trade-off가 있으나 전반적으로 동작성 개선과 품질 간 균형을 보인다.
Kim et al. (Thu,) studied this question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: