PyoSignal Logo
PyoSignal
← 커뮤니티로 돌아가기
Redditr/LocalLLaMALocalLLaMA

microsoft/Mage-VL · Hugging Face - An Efficient Codec-Native Streaming Multimodal Foundation Model

2026년 7월 28일 오후 06:47Error 추천0 댓글
#Benchmark#Efficient-AI#Multimodal#AI#Video-Understanding

요약

Microsoft에서 발표한 Mage-VL은 비디오 코덱 구조를 활용하여 효율적인 실시간 스트리밍을 구현한 멀티모달 파운데이션 모델입니다. 기존의 무거운 프레임 샘플링 방식 대신 코덱의 움직임 정보를 활용해 토큰 수를 75% 이상 절감하며 빠른 추론 속도를 제공합니다.

주요 내용

  • 코덱 기반의 희소성(Sparsity) 전략을 통해 움직임이 있는 영역의 패치만 유지함으로써 시각적 토큰을 75% 이상 줄이고 추론 속도를 최대 3.5배 향상시켰습니다.
  • Mage-ViT 시각 인코더와 Qwen3-4B 언어 백본을 결합하였으며, 시스템 1(인지 게이트)과 시스템 2(전체 VLM)의 이중 프로세스 설계를 통해 이벤트 발생 시에만 모델을 호출하는 효율적인 구조를 갖췄습니다.
  • H.264/HEVC와 같은 전통적 코덱부터 DCVC-RT와 같은 신경 코덱까지 모두 수용할 수 있는 코덱 불가지론적(Codec-agnostic) 설계를 채택했습니다.