MaLiang-Harness: A Programmable Path to Image and Video Generation
프로그램 코드를 통한 이미지/비디오 생성 시 발생하는 제어 불일치 문제를 해결하기 위한 통합 프레임워크 제안
논문이 다루는 내용
실행 가능한 코드를 통한 시각적 생성은 명시적 제어를 제공하지만, 코드가 의도한 구성이나 움직임을 정확히 구현하지 못하는 'Program-to-Visual (P2V)' 격차 문제가 발생합니다. 이를 해결하기 위해 MaLiang-Harness는 생성된 프로그램, 이력, 검증 과정을 하나의 참조로 관리하는 통합 프레임워크를 도입합니다. 핵심 설계로 상태를 보존하는 PEG, 편집 이력을 연결하는 TGP, 검증과 복원을 지원하는 REV 메커니즘을 통해 계획-실행-피드백 루프를 구축합니다. 실험 결과, GPT-6-Astra와 같은 고성능 MLLM이 높은 생성 성공률을 보였으나 일반 성능 점수와 시각적 생성 성능 사이에는 차이가 있음이 밝혀졌습니다. 이 연구는 프로그래밍 방식의 시각적 생성 연구를 위한 체계적인 기반을 제공합니다.
핵심 결과
-
P2V(Program-to-Visual) 격차 문제를 정의하고 이를 해결하기 위한 통합 프레임워크 MaLiang-Harness 제안
-
상태 보존(PEG), 추적 가능한 편집(TGP), 검증 및 복원(REV)을 결합한 반복적 생성 루프 설계
-
MLLM의 일반적 성능과 실제 시각적 생성 품질 사이의 상관관계가 낮음을 입증
실무에서 볼 만한 점
코드 기반의 자동화된 그래픽/영상 생성 파이프라인을 구축할 때, 생성된 결과물이 의도와 다를 경우 이를 어떻게 추적하고 수정할지에 대한 방법론을 제공합니다.
읽을 때 확인할 점
-
제공된 벤치마크(MaLiang-IBench/VBench)를 활용해 현재 사용 중인 MLLM의 시각적 제어 능력 테스트
-
코드 생성 기반의 이미지/비디오 생성 워크플로우에 PEG/TGP 개념 적용 실험
-
LLM이 생성한 코드가 시각적 요구사항을 충족하는지 검증하는 자동화 루프 설계