RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents
에이전트의 높은 성공률이 실제 언어 지시 이행 능력이 아닌 낮은 장면 엔트로피(Low Scene Entropy)에 의한 착시일 수 있음을 밝히고 이를 검증하는 벤치마크를 제안함
논문이 다루는 내용
최근 로봇 에이전트의 성공률은 높지만, 실제 언어 지시를 따르는 능력은 그에 못 미치는 경우가 많습니다. 연구진은 시각적 환경이 하나의 작업만을 허용할 때 언어가 불필요해지는 '낮은 장면 엔트로피' 현상이 성능 착시를 유발함을 발견했습니다. 이를 해결하기 위해 다양한 작업 분기(Task branches)를 포함하는 고엔트로피 환경인 RoboFollow 벤치마크를 도입했습니다. 이 벤치마크는 계층적 프로토콜을 통해 시각적 레이아웃과 의미론적 변화에 따른 에이전트의 반응을 정밀하게 진단합니다. 실험 결과, 기존 VLA 및 WAM 모델들은 높은 성공률에도 불구하고 복잡한 지시 이행 능력이 부족함을 보였으며, 기존의 일반적인 완화 기법들도 이 격차를 메우지 못했습니다.
핵심 결과
-
낮은 장면 엔트로피(Low Scene Entropy)로 인해 발생하는 에이전트 성능 착시 현상 규명
-
시각 정보만으로는 해결할 수 없는 다중 작업 분기를 포함하는 고엔트로피 벤치마크 'RoboFollow' 제안
-
의도(Intent)와 실행(Execution)을 분리하여 지시 이행 능력을 정밀 측정하는 4단계 계층적 프로토콜 설계
실무에서 볼 만한 점
에이전트 개발 시 단순히 성공률(Success Rate)만 높이는 것이 아니라, 환경의 복잡도에 상관없이 언어 지시를 정확히 반영하는지 검증하는 것이 필수적임을 시사합니다.
읽을 때 확인할 점
-
현재 개발 중인 에이전트 모델을 RoboFollow 데이터셋에 적용하여 지시 이행 격차 확인
-
학습 환경에 의도적으로 다중 작업 가능성을 부여하여 '낮은 엔트로피' 문제 방지
-
성공률 외에 의도(Intent)와 실행(Execution) 점수를 분리하여 성능 지표 설계