Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL
학습 과정에서 변화하는 보상 값과 모달리티 간 상호작용을 동적으로 조절하여 오디오-비디오 생성 품질을 최적화하는 적응형 RL 프레임워크
논문이 다루는 내용
멀티 보상 기반 강화학습은 오디오-비디오 생성 모델의 품질, 정렬, 동기화를 개선하는 유망한 방법이지만, 학습 중 변화하는 보상 위치와 가중치 조절이 어렵다는 문제가 있습니다. 기존 방식은 고정된 라우팅과 가중치를 사용하여 진화하는 모델 함수를 추적하지 못합니다. 이를 해결하기 위해 본 논문은 'Adaptive Reward Routing'을 제안하여 업데이트 위치와 보상 조합을 동시에 적응시킵니다. 구체적으로 교차 주의 집중(Cross-attention) 응답을 활용해 업데이트 위치를 동적으로 조정하고, 사전 정의된 가중치를 유지하면서 잔차 보정 방식으로 보상 간 충돌을 해결합니다. 실험 결과, 기존 RL 베이스라인 대비 모달리티 품질, 의미적 일관성, 오디오-비디오 동기화 성능이 모두 향상되었습니다.
핵심 결과
-
Cross-Modal Influence-Guided Routing: 교차 주의 응답을 프록시로 사용하여 모달리티 간 영향력에 따라 그래디언트와 손실 가중치를 동적으로 조정
-
Preference-Preserving Modality-Aware Reweighting: 사전 설정된 가중치를 우선순위로 유지하면서, 보상 그래디언트 간 상호작용을 통해 충돌을 해결하는 잔차 보정 방식 적용
-
Dynamic Optimization: 학습 과정에서 변화하는 모델 상태에 맞춰 업데이트 위치와 보상 조합을 실시간으로 최적화
실무에서 볼 만한 점
멀티모달 생성 모델 학습 시 특정 모달리티가 다른 모달리티를 압도하거나(Dominance), 정렬 성능이 저하되는 문제를 해결하는 데 유용합니다.
읽을 때 확인할 점
-
기존 고정 가중치 RL 방식과 제안된 적응형 가중치 방식의 학습 곡선(Convergence) 비교 실험
-
특정 모달리티(예: 오디오)의 가중치를 극단적으로 높였을 때의 안정성 테스트
-
Cross-attention 응답을 활용한 그래디언트 스케일링의 연산 오버헤드 측정