논문
Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control
실시간 키보드 조작과 텍스트 명령을 동시에 지원하는 5B 규모의 대화형 월드 모델 개발
논문이 다루는 내용
기존의 생성형 월드 모델은 실시간 상호작용과 일관된 이벤트 제어를 동시에 달성하는 데 어려움이 있었습니다. 본 논문은 사용자가 탐험과 이벤트 발생을 동시에 제어할 수 있는 5B 규모의 자기회귀 월드 모델인 Zing-0.5를 제안합니다. 핵심 방법론으로 키보드 입력과 텍스트 지시를 통합한 조건부 학습, 세그먼트 단위 교사를 활용한 증류 기반의 점진적 생성 방식, 그리고 저비용 실시간 추론 기술을 결합했습니다. 실험 결과, WBench 내비게이션 작업에서 높은 일관성을 보였으며 생성 재시작 없이 텍스트로 이벤트를 변경하는 데 성공했습니다. 최종적으로 모델 가중치와 추론 코드를 공개하여 실시간 플레이 가능한 생성형 월드의 발전을 도모합니다.
핵심 결과
-
키보드 입력(크기 인지)과 텍스트 명령을 하나의 시퀀스 내에서 통합 학습하는 방식 도입
-
연결된 멀티 프롬프트 비디오를 활용한 세그먼트 단위 교사 모델 기반의 분포 매칭 증류 기법
-
4단계 생성과 컨텍스트 보존 스트리밍을 결합하여 저비용(분당 약 $0.009) 실시간 추론 구현
실무에서 볼 만한 점
사용자의 물리적 조작과 텍스트 명령이 결합된 인터랙티브 콘텐츠 생성 엔진의 가능성을 제시합니다.
읽을 때 확인할 점
-
제공된 SGLang 구현체를 활용한 실시간 추론 성능 벤치마크 수행
-
키보드 조작과 텍스트 명령 간의 우선순위 및 간섭 현상 분석
-
저비용 스트리밍 환경에서의 시각적 일관성 유지 여부 테스트