논문
Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model
언어를 물리적 법칙의 표현 수단으로 활용하여 비디오 생성 모델의 물리적 정밀도를 높이는 자기 진화형 프레임워크
논문이 다루는 내용
기존 비디오 월드 모델은 시각적으로는 그럴듯하지만 물리 법칙을 위반하는 영상을 생성하는 문제가 있었습니다. 기존 방식은 언어만으로는 물리 지식을 충분히 담을 수 없다고 가정하고 별도의 시각적/수치적 신호를 추가해 왔습니다. 본 논문은 언어를 물리적 표현의 핵심 매개체로 삼는 Physis-Lang 프레임워크를 제안합니다. PhysCapBench를 통해 물리적 과정을 원자적 명제로 분해하고, 에이전트 루프를 통해 캡션과 모델의 결함을 반복적으로 수정하며 학습합니다. 실험 결과, 오픈소스 백본을 활용했음에도 불구하고 독보적인 성능의 Veo 3.1 모델을 능가하는 물리적 타당성을 입증했습니다.
핵심 결과
-
언어를 물리적 엔티티, 인과관계, 상호작용 등을 기술하는 최적화 가능한 표현 수단으로 재정의
-
물리적 과정을 원자적 명제로 분해하여 평가하는 PhysCapBench 및 에이전트 기반 자기 진화 루프 도입
-
언어 가이드 기반 검색을 통해 부족한 물리적 과정을 보완하는 데이터 큐레이션 전략
실무에서 볼 만한 점
비디오 생성 모델 개발 시 별도의 물리 엔진 없이도 정교한 텍스트 캡셔닝과 데이터 루프만으로 물리적 정밀도를 높일 수 있는 방법론을 제시합니다.
읽을 때 확인할 점
-
기존 비디오 생성 모델의 캡션 데이터셋을 물리적 인과관계 중심으로 재구성해보기
-
에이전트 루프를 활용한 텍스트-비디오 피드백 루프 설계 실험
-
물리적 속성(중력, 충돌 등)을 명시적으로 포함하는 데이터 증강 기법 적용