Fewer Tokens, Better Action: GPT-6 Astra Robot Agents with 14% Higher Success Rate but 65% Fewer Tokens
코드 실행 프레임워크를 통해 로봇 에이전트의 토큰 소모를 65% 줄이면서도 성공률을 14% 높인 효율적 제어 기법
논문이 다루는 내용
VLM 기반 로봇 에이전트는 시각적 피드백을 통한 반복적인 모델 호출로 인해 막대한 토큰 비용이 발생하는 문제가 있습니다. 이를 해결하기 위해 피드백 기반의 프리미티브 구성과 선택적 관찰을 결합한 PyRUA-Lean 프레임워크를 제안합니다. 에이전트는 로봇 동작과 VLA 정책을 Python 코드로 결합하여 로컬에서 조건부 체크 및 재시도를 수행하며, 필요한 경우에만 상태 피드백을 반환합니다. 700개의 시뮬레이션 환경 테스트 결과, 동일한 LLM 호출 예산 하에서 성공률을 63.1%에서 71.7%로 높였습니다. 또한 동일 작업 해결 시 LLM 호출 횟수는 49%, 입력 토큰은 65% 절감하는 성과를 거두었습니다.
핵심 결과
-
PyRUA-Lean: 코드 실행 기반의 인터랙티브 프레임워크 도입
-
로컬 루프: Python 셀 내에서 조건부 체크 및 로컬 재시도를 수행하여 불필요한 LLM 호출 방지
-
선택적 관찰: 필요한 시점에만 이미지와 상태를 요청하여 토큰 효율성 극대화
실무에서 볼 만한 점
에이전트 설계 시 모든 동작을 LLM에 묻는 대신, 로컬 코드 실행(Code-Execution)과 상태 피드백을 결합하는 것이 비용과 성능 면에서 훨씬 유리함을 보여줍니다.
읽을 때 확인할 점
-
에이전트의 동작 단위를 Python 함수/클래스로 모듈화하여 코드 실행 환경 구축하기
-
상태 확인(Check)과 동작(Action)을 분리하여 로컬 루프 로직 설계하기
-
시각적 피드백 주기를 조절하며 토큰 절감 대비 성공률 변화 측정하기