PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

EchoWM: Open and Enterable Omnimodal World Models

논문 ID: 2608.2318963 추천
#World Model#Generative AI#Multimodal#Video Generation#Robotics#Video#Audio#Benchmark#Evaluation
EchoWM: Open and Enterable Omnimodal World Models

핵심 요약

연속적인 내비게이션 제어가 가능한 720p 고화질 영상 및 오디오 통합 생성 월드 모델

상세 내용

기존의 생성형 미디어는 실시간 상호작용과 정교한 카메라 제어를 동시에 달성하는 데 어려움이 있었습니다. 본 논문은 1인칭 및 칭칭칭 시점의 카메라 움직임을 제어하며 영상, 환경음, 음악, 음성을 동시에 생성하는 EchoWM을 제안합니다. 이 모델은 이산적 명령과 연속적 포즈를 공유된 6-DoF 궤적으로 매핑하여 데이터 간 모션 크기를 보존합니다. 데이터 엔진 구축과 점진적 학습 및 자기회귀적 사후 학습 방식을 통해 장기 생성 성능을 확보했습니다. 실험 결과, EchoWM은 궤적 추종 능력과 시각적 품질이 뛰어나며 다양한 시점과 주제에서 동기화된 오디오-비주얼 생성을 입증했습니다.

주요 내용

  • 영상, 환경음, 음악, 음성을 동시에 생성하는 옴니모달(Omnimodal) 생성 프레임워크
  • 1인칭/3인칭 시점을 모두 지원하는 6-DoF 상대적 궤적 제어 메커니즘
  • 장기 생성(Long-horizon)을 위한 점진적 학습 및 자기회귀적 사후 학습 전략

실무에서 볼 만한 점

가상 현실(VR/AR) 및 게임 엔진용 생성형 에셋 제작 시, 사용자 움직임에 반응하는 고품질 인터랙티브 환경을 구축하는 데 핵심적인 기술이 될 수 있습니다.

참고할 행동

  • 제공된 6-DoF 궤적 제어 방식이 기존 물리 엔진과 어떻게 호환되는지 분석
  • 장기 생성 시 오디오-비주얼 동기화 유지력을 확인하기 위한 벤치마크 테스트
  • 다양한 카메라 시점(1인칭 vs 3인칭) 전환 시의 일관성 검증