InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation
재학습 없이 LLM과 수치 최적화를 결합하여 휴머노이드의 기존 제어 능력을 새로운 작업에 맞게 진화시키는 테스트 타임 최적화 프레임워크
논문이 다루는 내용
기존의 휴머노이드 제어 방식은 학습되지 않은 새로운 작업에 직면했을 때 재학습 없이는 대응하기 어렵다는 문제가 있습니다. 본 논문은 기존 컨트롤러가 가진 잠재적 역량을 활용하여 새로운 작업을 수행하는 '테스트 타임 진화(Test-time evolution)'를 제안합니다. 이를 위해 객체 인지 기반의 Forward-Backward(FB) 행동 파운데이션 모델과, LLM이 구조를 수정하고 수치 최적화가 상수를 조정하는 '보상 프로그램(Reward Program)' 인터페이스를 개발했습니다. 실험 결과, 제안된 방식은 사람이 설계한 보상보다 더 효율적으로 컨트롤러의 역량을 끌어내며 복잡한 작업과 장기적 과제를 성공적으로 수행했습니다. 최종적으로 시뮬레이션에서 진화된 기술은 실제 Unitree G1 로봇에서 자율적으로 구동됨을 입증했습니다.
핵심 결과
-
재학습 없이 기존 컨트롤러의 역량을 새로운 작업에 맞게 재구성하는 테스트 타임 진화 기법
-
LLM(구조 설계)과 수치 최적화(상수 튜닝)를 결합한 하이브리드 보상 프로그램 생성
-
객체 잔차(Object residuals)를 활용하여 제어 능력을 작업에 맞게 변환하는 FB 파운데이션 모델
실무에서 볼 만한 점
모델 전체를 재학습하는 막대한 비용 없이, 프롬프트와 보상 함수 수정만으로 로봇의 행동을 실시간으로 최적화하는 새로운 패러다임을 제시합니다.
읽을 때 확인할 점
-
LLM 기반 보상 함수 생성 시 수치적 안정성을 확보하기 위한 제약 조건 설계 실험
-
기존 강화학습 모델의 파라미터를 고정한 상태에서 보상 함수만 변경할 때의 성능 변화 측정
-
다양한 로봇 하드웨어(Sim-to-Real)로의 전이 가능성 검토