논문Hugging Face
WorldClaw: Agentic 3D Open-World Generation at Scale
논문 ID: 2608.0524846 추천
#3D Generation#Agentic Workflow#Open-World#Procedural Content#Agent
핵심 요약
에이전트 기반의 Coarse-to-Fine 프레임워크를 통해 대규모 3D 오픈월드와 편집 가능한 에셋을 동시에 생성하는 기술
상세 내용
텍스트 기반의 대규모 3D 월드 생성은 전역적 공간 일관성과 풍부한 지역 콘텐츠, 그리고 재사용 가능한 에셋 확보를 동시에 달성해야 하는 난제가 있습니다. 본 논문은 에이전트 중심의 Coarse-to-Fine 프레임워크인 WorldClaw를 제안합니다. 먼저 계획 에이전트가 텍스트를 구조화된 사양으로 변환하면, 시스템은 의미론적 레이아웃을 바탕으로 전역 지형 기초를 구축합니다. 이후 세부 묘사가 필요한 영역에 대해 지형 조건부 합성 및 편집 가능한 메시 재구성을 수행하며, 렌더링 기반 에이전트가 최종적인 외형과 접촉면을 정교화합니다. 결과적으로 WorldClaw는 일관된 지형 구조를 유지하면서도 시각적으로 매력적이고 편집 가능한 인스턴스 에셋을 포함한 대규모 장면을 생성합니다.
주요 내용
- 에이전트 기반의 Coarse-to-Fine 전략을 통한 대규모 3D 장면 생성
- 전역적 지형 일관성과 지역적 디테일(편집 가능한 에셋) 간의 균형 유지
- 계획, 생성, 정교화 단계로 이어지는 구조적 워크플로우
실무에서 볼 만한 점
게임 개발이나 메타버스 환경 구축 시, 텍스트만으로 구조적 일관성과 편집 가능성을 모두 갖춘 대규모 맵을 자동 생성할 수 있는 가능성을 제시합니다.
참고할 행동
- 제시된 Coarse-to-Fine 워크플로우의 단계별 에이전트 역할 분담 구조 분석
- 생성된 메시(Mesh)의 편집 가능성과 다운스트림 엔진(Unity/Unreal) 호환성 검토
- 텍스트 프롬프트의 복잡도에 따른 지형-에셋 간의 일관성 유지 능력 테스트