EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making
사전 학습된 LLM의 세계 지식을 활용하여 에이전트의 환경 전이 성능과 의사결정 범용성을 높이는 새로운 사후 학습(Post-training) 기법
논문이 다루는 내용
LLM 기반 에이전트는 멀티스텝 의사결정 능력을 갖추고 있으나, 학습하지 않은 새로운 환경으로의 전이 성능이 낮다는 문제가 있습니다. 기존의 월드 모델 방식은 추가 학습 비용이 크고 예측 오차가 누적되는 단점이 있지만, 디지털 환경의 LLM은 이미 방대한 세계 지식을 내재하고 있습니다. 본 논문은 기존의 단일 목표 중심 사후 학습이 에이전트로 하여금 표면적인 맥락에만 의존하게 만든다고 지적합니다. 이를 해결하기 위해 제안된 EVOKE는 동일한 상태에서 다양한 목표를 부여하여 행동 선호도를 재배열함으로써, 내재된 세계 지식을 끌어내는 압력을 가합니다. 실험 결과, EVOKE는 다양한 백본 모델에서 작업 성능, 미학습 환경 일반화, 데이터 효율성을 모두 개선했습니다.
핵심 결과
-
목표 다양성(Goal Diversity)을 활용한 사후 학습 프레임워크 EVOKE 제안
-
동일한 환경 상태에서 다양한 목표를 부여하여 에이전트가 내재된 세계 지식을 활용하도록 강제
-
표면적 맥락 의존성을 탈피하여 미학습 환경에 대한 일반화 성능 및 데이터 효율성 확보
실무에서 볼 만한 점
에이전트가 특정 작업에만 매몰되지 않고, 이미 학습된 지식을 바탕으로 새로운 환경에서도 유연하게 동작하게 만드는 전략을 제공합니다.
읽을 때 확인할 점
-
동일한 프롬프트/상태에서 목표(Goal)만 변경하며 행동 순위가 어떻게 변하는지 테스트
-
단일 목표로 학습된 에이전트와 EVOKE 적용 에이전트의 환경 전이 성능 비교
-
다양한 규모의 LLM 백본에 EVOKE 기법을 적용하여 스케일링 효과 확인