Omni-IO Skills: Harnessing Your Agent Omni-Native
기존 LLM의 추론 코어를 유지하면서 다양한 모달리티를 플러그인 방식으로 확장하는 에이전트 프레임워크 제안
논문이 다루는 내용
범용 에이전트는 다양한 모달리티(텍text, 이미지, 비디오 등)를 다루어야 하지만, 모델 업데이트 비용과 복잡한 워크플로우 관리 문제로 인해 능력이 파편화되어 있습니다. 본 논문은 기존 에이전트를 '옴니 네이티브'로 만드는 플러그 앤 플레이 방식의 'Omni-IO Skills' 프레임워크를 제안합니다. 이 시스템은 계층적 Skill, 표준화된 실행 인터페이스, 의존성 인식 오케스트레이션, 자산 레지스트리를 핵심 구성 요소로 가집니다. 멀티 에셋 워크플로우는 선언적 실행 그래프(Declare Execution Graphs)를 통해 스케줄링되며, 생성된 결과물은 재사용 가능한 자산으로 등록됩니다. 실험 결과, 기존 모델의 입력 지원율을 100%로 끌어올리고 의미적 품질 점수를 대폭 향상시켰습니다. 이를 통해 모델 코어를 수정하지 않고도 확장 가능한 옴니 시스템을 구축할 수 있음을 입증했습니다.
핵심 결과
-
계층적 Skill과 표준화된 인터페이스를 통한 모달리티 확장성 확보
-
의존성 인식 오케스트레이션 및 자산 레지스트리를 통한 워크플로우 관리
-
기존 추론 모델의 코어를 변경하지 않는 플러그 앤 플레이 방식의 아키텍처
실무에서 볼 만한 점
모델을 매번 파인튜닝하거나 복잡한 도구 연동 코드를 새로 짜는 대신, 표준화된 인터페이스를 통해 새로운 모달리티 기능을 즉시 주입할 수 있는 구조를 제공합니다.
읽을 때 확인할 점
-
제시된 'Declare Execution Graphs' 개념을 기존 LangChain/LangGraph 워크플로우에 적용해보기
-
특정 도구(Tool)를 표준화된 'Skill' 인터페이스로 래핑하는 프로토타입 설계
-
멀티 모달 자산(이미지, 코드 등)의 상태 관리를 위한 중앙 레지스트리 구조 설계