AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation
모델 가중치를 고정한 상태에서 코딩 에이전트를 통해 멀티 레퍼런스 이미지 생성용 하네스를 자동 최적화하는 프레임워크
논문이 다루는 내용
최근 멀티 레퍼런스 이미지 생성 모델은 여러 참조 이미지를 자연스럽게 결합하는 데 어려움을 겪고 있습니다. 기존의 에이전트 방식은 하네스(Harness) 설계에 따라 성능 편차가 크며, 수동 설계로는 복잡한 생성 기준을 충족하기 어렵습니다. 본 논문은 모델을 동결한 채 코딩 에이전트가 하네스 코드를 반복적으로 재작성하며 최적화하는 AutoRef를 제안합니다. AutoRef는 피드백 제공 작업과 후보 선택 작업을 분리하고 빔 서치(Beam Search)를 통해 최적의 하네스를 탐색합니다. 실험 결과, 제안된 하네스는 FLUX.2 모델의 성능을 크게 향상시켜 독점 모델 수준의 성능을 달성했습니다. 또한 학습된 하네스는 모델이나 벤치마크가 바뀌어도 범용적인 성능 향상을 보여주었습니다.
핵심 결과
-
모델 가중치를 수정하지 않고 실행 가능한 프로그램(Harness)만 최적화하여 성능 극대화
-
코딩 에이전트를 활용한 반복적인 하네스 코드 재작성 및 자동 최적화 메커니즘
-
피드백과 선택 작업을 분리하고 빔 서치를 적용하여 탐색 효율성 확보
실무에서 볼 만한 점
모델 자체를 재학습(Fine-tuning)하는 비용 없이, 기존 오픈소스 모델의 활용도를 극대화할 수 있는 실용적인 프레임워크를 제시합니다.
읽을 때 확인할 점
-
FLUX.2와 같은 오픈소스 모델에 AutoRef 프레임워크를 적용하여 성능 벤치마크 수행
-
특정 도메인(예: 캐릭터 일관성 유지)에 특화된 하네스 코드 생성 실험
-
에이전트 기반 코드 생성 시 발생하는 논리적 오류 및 무한 루프 방지 전략 검토