PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

논문 ID: 2608.2405354 추천
#Multimodal#Embedding#Search#Recommendation#Agent#RAG#Vision#Video#Benchmark#Evaluation#Safety
WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

핵심 요약

텍스트, 이미지, 비디오를 아우르는 위챗(WeChat) 규모의 범용 멀티모달 임베딩 모델 WeMM-Embedding 공개

상세 내용

현대 AI 시스템에서 이종 콘텐츠를 공유 공간에 표현하는 범용 멀티모달 임베딩의 중요성이 커지고 있습니다. 본 보고서는 텍스트, 이미지, 비디오, 시각적 문서 및 혼합 입력을 지원하는 WeMM-Embedding 모델군을 소개합니다. 모델은 2B, 4B, 9B 크기로 구성되며, 대규모 정렬 단계와 정교한 데이터 및 지식 전이를 활용한 정제 단계의 2단계 학습 과정을 거칩니다. 실험 결과, 2B 모델이 기존 8B 모델을 능가하고 9B 모델은 SOTA 성능을 달성했습니다. 또한 위챗의 검색, 추천, 이커머스 등 실제 서비스에 배포되어 실질적인 성능 향상을 입증했습니다.

주요 내용

  • 텍스트, 이미지, 비디오, 문서 등 다양한 모달리티와 혼합 입력을 지원하는 범용 임베딩 모델
  • 대규모 정렬 및 정교한 데이터 정제/지식 전이를 결합한 2단계 학습 전략
  • 2B~9B 규모의 모델 라인업으로 효율성과 성능 사이의 유연한 선택 가능

실무에서 볼 만한 점

검색, 추천, RAG 시스템 구축 시 다양한 형태의 데이터를 하나의 벡터 공간에서 처리할 수 있는 강력한 엔드투엔드 솔루션을 제공합니다.

참고할 행동

  • 공개된 가중치를 활용하여 기존 텍스트 전용 임베딩 모델과의 성능 비교 실험
  • 도메인 특화 데이터(시각적 문서 등)를 활용한 파인튜닝 성능 검증
  • 다양한 모달리티가 혼합된 RAG 파이프라인에 적용하여 검색 정확도 테스트