PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents
멀티턴 에이전트의 치명적 실수를 방지하고, 실수 발생 시 다시 성공 궤도로 복구하는 능력을 학습시키는 온폴리시 증류 프레임워크
논문이 다루는 내용
멀티턴 에이전트 학습 시 발생하는 오류는 다음 상태에 영향을 주어 에러가 누적되는 문제를 야기합니다. 연구진은 실패 사례의 절반 이상이 초기에 발생하는 '결정적 실수(pivotal mistake)'에서 비롯되지만, 이는 몇 번의 가이드만으로 복구 가능하다는 점을 발견했습니다. 이를 해결하기 위해 PivotOPD는 실수를 방지하는 '예방적 증류'와 실수 이후 상태에서 복구하는 '복구형 증류'를 결합한 프레임워크를 제안합니다. 실험 결과, ALFWorld, WebShop 등 다양한 벤치마크에서 기존 베이스라인 대비 우수한 성능 향상을 달성했습니다. 특히 모델 크기가 작은 학생 모델에서도 강력한 성능 개선과 도메인 전이 효과를 입증했습니다.
핵심 결과
-
실수 발생 시 상태가 변하는 멀티턴 환경의 누적 오류 문제 정의
-
실수를 방지하는 Gold Action(Reverse KL)과 복구 행동을 학습하는 Recovery Action(Forward KL)의 이중 구조
-
초기 실수를 방지함과 동시에 실수 후 상태에서도 성공 궤도로 돌아오는 복구 능력 확보
실무에서 볼 만한 점
에이전트가 한 번의 실수로 전체 태스크를 망치는 것을 방지하고, 오류 발생 시 스스로 복구할 수 있는 강건한(robust) 시스템을 구축하는 데 유용합니다.
읽을 때 확인할 점
-
에이전트 실패 로그에서 '결정적 실수'와 '복구 가능성'의 상관관계 분석
-
On-policy 데이터셋에 복구 시나리오(Recovery trajectories)를 포함하여 학습 실험
-
KL-divergence를 활용한 방지(Preventive) vs 복구(Recovery) 손실 함수 비중 조절