LEGO-Anything: Coding Agents for 3D Scene Reconstruction
단일 이미지를 편집 가능한 3D 장면 프로그램으로 변환하는 코딩 에이전트 프레임워크 제안
논문이 다루는 내용
기존의 3D 재구성 방식은 고정된 출력물 형태라 편집이나 질의가 어렵다는 한계가 있습니다. 이를 해결하기 위해 코딩 에이전트가 Blender 코드를 반복적으로 작성, 실행, 수정하며 3D 장면을 구축하는 LEGO-Anything 프레임워크를 제안합니다. 평가를 위해 시뮬레이터 기반의 LEGO-Bench 벤치마크를 도입하여 기하학적 정확도와 렌더링 품질을 측정했습니다. 실험 결과, GPT-6-astra가 가장 우수한 성능을 보였으나 초기화 실패 및 편집 회귀와 같은 문제가 발견되었습니다. 이를 보완하기 위해 제어 가능한 반복 구성을 지원하는 LEGO-Plugin을 개발하여 성능을 대폭 향상시켰습니다. 최종적으로 재구성된 장면이 객체 탐지 및 깊이 추정 등 비전 작업에 활용될 수 있음을 입증했습니다.
핵심 결과
-
이미지를 편집 가능한 코드로 변환하는 Image-to-Code 프레임워크(LEGO-Anything) 개발
-
시뮬레이터 기반의 정밀한 3D 재구성 평가 벤치마크(LEGO-Bench) 구축
-
에이전트의 반복적 편집 문제를 해결하기 위한 제어용 플러그인(LEGO-Plugin) 제안
실무에서 볼 만한 점
단순한 3D 모델 생성을 넘어, 코드를 통해 수정·조작이 가능한 '프로그램 형태의 3D 장면'을 생성하는 새로운 워크플로우를 제시합니다.
읽을 때 확인할 점
-
Blender Python API와 LLM을 결합한 자동화 파이프라인 구축 실험
-
에이전트의 반복적 편집 과정에서 발생하는 '회귀(Regression)' 문제 방지 로직 설계
-
생성된 3D 장면을 기반으로 한 비전 태스크(Depth, Mask) 성능 검증