논문Hugging Face
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
논문 ID: 2608.2049288 추천
#Video-LLM#Reinforcement-Learning#Efficiency#Multimodal#RAG#Video#Benchmark
핵심 요약
고비용 CoT 생성 없이도 어노테이션을 직접 최적화 타겟으로 활용하여 비디오 MLLM의 학습 효율과 성능을 극대화하는 RL 프레임워크
상세 내용
비디오 MLLM의 사후 학습(post-training) 시 기존 RL 방식은 고품질 롤아웃 확보와 CoT 생성 비용 문제로 인해 효율성이 낮습니다. 본 논문은 어노테이션이 단순 점수 부여를 넘어 직접적인 최적화 타겟(oracle rollout)이 될 수 있음에 주목합니다. 하지만 높은 보상을 가진 oracle이 베이스라인을 높여 학습을 방해하는 'advantage inversion' 문제가 발생합니다. 이를 해결하기 위해 OraRL은 정책 롤아웃과 oracle 간의 차이를 분리하여 계산하는 decoupled advantage estimator를 제안합니다. 또한 sign-balanced pruning을 통해 효율적인 샘플링을 수행합니다. 결과적으로 OraRL은 기존 GRPO 대비 훨씬 빠른 속도로 더 높은 비디오 이해 성능을 달mat했습니다.
주요 내용
- 어노테이션을 직접적인 긍정 최적화 타겟(oracle rollout)으로 활용하는 새로운 RL 패러다임 제안
- 고득점 oracle이 학습을 방해하는 'advantage inversion' 문제를 해결하는 decoupled advantage estimator 도입
- CoT 생성 없이도 높은 성능을 내며, GRPO 대비 약 2배 이상의 학습 속도 효율성 확보
실무에서 볼 만한 점
비디오 데이터 학습 시 막대한 비용이 드는 CoT 생성 없이도, 기존의 정답(annotation)을 효율적으로 RL에 녹여낼 수 있는 실무적인 방법론을 제시합니다.
참고할 행동
- 기존 RL(GRPO 등) 학습 시 발생하는 advantage inversion 현상이 발생하는지 모니터링
- 보유한 정답 데이터(Ground Truth)를 RL의 oracle로 활용하는 실험 설계
- 모델 크기 및 데이터 규모에 따른 OraRL의 스케일링 효율성 검증