Agent Priors-guided Policy Learning
정책의 구조적 사전 지식(Structural Prior)을 활용하여 스킬 학습과 조합 간의 간극을 메우고 새로운 작업에 대한 일반화 성능을 높인 프레임워크
논문이 다루는 내용
로봇이 소수의 데모로부터 학습할 때, 스킬의 조합(Compositional)과 스킬 자체의 일반화(Skill generalization)가 서로 의존적임에도 불구하고 정보 손실이 발생하는 문제가 있습니다. 기존 방식은 스킬을 단순한 이름이나 기호로만 취급하여 스킬의 구조적 특성을 조합 과정에 반영하지 못합니다. 본 논문은 각 정책의 구조적 사전 지식(Structural Prior)을 스킬과 조합 인터페이스 사이의 가교로 사용하는 APPL 방식을 제안합니다. 학습 시에는 스킬이 무엇에 의존하는지 정의하고, 실행 시에는 이 사전 지식을 바탕으로 적절한 정책을 선택하고 조합합니다. 실험 결과, MetaWorld 및 ManiSkill 환경에서 OOD(Out-of-distribution) 일반화와 미학습 스킬 조합 성능이 크게 향상되었습니다.
핵심 결과
-
스킬의 구조적 사전 지식(Structural Prior)을 활용한 스킬-조합 간 인터페이스 설계
-
데모를 재사용 가능한 스킬로 분할하고, 각 스킬에 대해 여러 구조적 가정을 적용하여 학습하는 자동화 파이프라인
-
학습 시 정의된 구조적 제약이 실행 시 스킬 선택 및 조합의 가이드 역할을 수행
실무에서 볼 만한 점
복잡한 로봇 작업을 수행할 때, 개별 스킬의 물리적 특성을 유지하면서도 새로운 작업 조합에 유연하게 대응할 수 있는 구조적 설계 방식을 제시합니다.
읽을 때 확인할 점
-
제시된 구조적 사전 지식(예: 그리퍼 포즈와 물체 간 관계)이 실제 물리 환경에서 유효한지 검증
-
기존의 단순한 스킬 명칭 기반 조합 방식과 APPL 방식의 성능 차이 비교 실험
-
다양한 환경 변화(OOD) 상황에서 구조적 제약이 일반화에 미치는 영향 분석