OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning
멀티턴 도구 사용을 통해 긴 오디오-비주얼 데이터에서 필요한 증거를 능동적으로 탐색하는 에이전트 프레임워크
논문이 다루는 내용
기존의 멀티모달 모델은 긴 오디오-비주얼 시퀀스를 한 번의 추론으로 처리하려 하여 효율성과 정확도에 한계가 있었습니다. 이를 해결하기 위해 OmniSeek은 모델이 능동적으로 특정 시간대의 오디오나 비주얼 세그먼트를 선택하여 가져오는 에이전트 프레임워크를 제안합니다. 연구진은 멀티홉 추론 경로가 포함된 OmniTraj-170K 데이터셋을 구축하고, 두 단계의 강화학습을 통해 도구 사용 정책을 최적화했습니다. 특히 단일 모달리티에 의존하는 지름길을 방지하기 위해 오디오-비주얼 상호 의존성을 강조하는 목적 함수를 도입했습니다. 실험 결과, OmniSeek은 적응형 증거 탐색 능력을 학습하여 다양한 벤치마크에서 우수한 추론 성능을 입증했습니다.
핵심 결과
-
능동적 증거 획득: 전체 데이터를 한 번에 처리하는 대신, 필요한 시간대의 오디오/비주얼 세그먼트를 동적으로 선택하는 에이전트 방식
-
OmniTraj-170K 데이터 엔진: 멀티홉 CoT 추론 경로와 인터리브된 증거가 포함된 합성 데이터셋 구축
-
이중 모달리티 최적화: 단일 모달리티로 문제를 해결하는 편법을 막기 위한 Audio-Visual Necessity 목적 함수 적용
실무에서 볼 만한 점
긴 영상이나 오디오 데이터를 다룰 때 전체를 모델에 넣는 대신, 필요한 부분만 골라 쓰는 효율적인 RAG(Retrieval-Augmented Generation) 형태의 에이전트 설계 방식을 제시합니다.
읽을 때 확인할 점
-
긴 영상 데이터에 대해 특정 구간만 잘라 입력하는 에이전트 루프 구현 실험
-
멀티모달 데이터셋 구축 시 CoT(Chain-of-Thought)를 결합한 합성 데이터 생성 파이프라인 설계
-
단일 모달리티 편향을 막기 위한 보상 함수(Reward Function) 설계 테스트