PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

논문 ID: 2608.2095852 추천
#Multi-modal#Live-streaming#Reinforcement Learning#Video-Language#Reasoning#Vision#Video#Audio#Benchmark#Safety
TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

핵심 요약

이커머스 라이브 스트리밍의 복합 모달리티(음성, 영상, 텍ext 등)를 통합 이해하고 실시간 응답을 생성하는 옴니모달 모델 연구

상세 내용

이커머스 라이브 스트리밍은 노이즈가 많고 시간적으로 긴 영상 내에 제품 정보가 여러 모달리티에 분산되어 있어 이해가 어렵습니다. 이를 해결하기 위해 이미지, 비디오, 오디오, 텍스트를 하나의 표현 공간으로 매핑하는 TLive-Omni 모델을 제안합니다. 시간적 정렬을 위해 Per-vGrid라는 타임스탬프 기반 토큰 구조를 도입하고, 인지에서 응답까지 단계별로 발전하는 3단계 학습 레시피를 설계했습니다. 또한, 실시간 요구사항을 충족하면서 답변의 신뢰도를 높이기 위해 작업 검증 피드백 기반의 Faithful-RFT 강화 학습을 적용했습니다. 실험 결과, 이커머스 도메인 작업에서 강력한 성능을 보였으며 일반 벤치마크에서도 우수한 일반화 성능을 입증했습니다.

주요 내용

  • Per-vGrid: 시간적 정렬을 위해 비디오 그리드와 오디오를 결합하는 타임스탬프 기반 토큰 구조 도입
  • Faithful-RFT: 실시간성을 유지하며 답변의 신뢰도와 표현력을 높이는 강화 학습 단계 설계
  • Atomic Capability Taxonomy: 이커머스 특화 데이터 생산 엔진 및 시나리오 중심의 역량 분류 체계 구축

실무에서 볼 만한 점

멀티모달 데이터(영상+음성+텍스트)가 혼재된 실시간 스트리밍 환경에서 정교한 정보 추출 및 QA 시스템을 구축하는 데 유용한 아키텍처를 제시합니다.

참고할 행동

  • Per-vGrid와 같은 시간적 정렬 구조를 기존 비디오-언어 모델에 적용해보기
  • 실시간 응답 품질을 위해 RLHF/RFT 시 피드백 루프 설계 방식 비교하기
  • 도메인 특화 데이터셋 구축을 위한 자동화된 데이터 생산 파이프라인 검토하기