PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

논문 ID: 2608.0443645 추천
#Agent#Multimodal#Image Generation#Reinforcement Learning#Reasoning#Vision
ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

핵심 요약

추론, 도구 사용, 이미지 생성을 하나의 정책으로 통합하여 복잡한 요구사항을 해결하는 에이전트 기반 이미지 생성 모델

상세 내용

기존의 텍스트-이미지(T2I) 모델은 복잡한 의미 이해나 외부 지식 통합이 필요한 오픈 월드 작업에서 한계를 보였습니다. 기존 에이전트 방식은 워크플로우가 고정되어 있거나 생성 과정의 일부만 제어하여 추론과 도구 사용이 유기적으로 결합되지 못했습니다. 이를 해결하기 위해 본 논문은 통합 멀티모달 모델(UMM)을 사후 학습시킨 ToolArtist를 제안합니다. SFT 단계에서 검색 및 생성 도구를 사용하는 교사 에이전트의 궤적을 학습 데이터로 변환하고, RL 단계에서는 의도와 품질 보상을 결합한 RAD-GRPO 알고리즘을 적용했습니다. 실험 결과, 전체 생성 과정을 단일 에이전트 정책으로 관리하는 방식이 기존의 고정된 파이프라인보다 우수한 성능을 입증했습니다.

주요 내용

  • 추론, 도구 호출, 이미지 생성을 하나의 통합 정책(Unified Policy)으로 관리하는 UMM 구조
  • SFT를 통한 도구 사용 궤적 학습 및 RL을 위한 RAD-GRPO 알고리즘 개발
  • 고정된 워크플로우를 탈피하여 동적인 에이전트 제어 방식 도입

실무에서 볼 만한 점

단순한 프롬프트 입력을 넘어, 외부 지식 검색이나 복잡한 단계별 추론이 필요한 고도화된 이미지 생성 에이전트 설계의 이정표를 제시합니다.

참고할 행동

  • 제공된 학습 데이터셋을 활용하여 소규모 UMM 모델에 SFT 적용 실험
  • RAD-GRPO와 같은 보상 모델이 이미지 품질과 의도 일치도에 미치는 영향 분석
  • 기존 고정형 파이프라인(Fixed Pipeline) 대비 에이전트 방식의 효율성 비교