PyoSignal Logo
PyoSignal
← 논문 목록으로 돌아가기
논문Hugging Face

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

논문 ID: 2608.00677159 추천
#AI Agent#Red Teaming#Security#Environment Evolution#Agent#Benchmark#Evaluation#Safety
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

핵심 요약

복잡한 상태 변화가 발생하는 에이전트 환경에서 보안 취약점을 탐지하기 위한 대규모 오픈 엔드 레드팀 프레임워크 제안

상세 내용

기존의 에이전트 안전성 벤치마크는 정적이고 짧은 작업에 집중하여, 상태 변화가 누적되는 장기 워크플로우에서의 위험을 포착하지 못합니다. 이를 해결하기 위해 환경 진화를 통해 에이전트 레드팀을 수행하는 OpenART 프레임워크를 도입합니다. OpenART는 50개 도메인에 걸친 10,000개 이상의 상태 기반 시나리오와 방대한 툴/스킬 풀을 제공합니다. 공격 방식으로는 피드백 기반의 환경 진화를 수행하는 EMHA(Evolutionary Markov Hypergraph Attack)를 제안합니다. 실험 결과, EMHA는 복잡한 환경일수록 더 높은 공격 성공률을 보이며 환경 변화가 안전성 실패를 유도함을 입증했습니다. 또한 에이전트의 런타임 구현 방식이 모델 자체의 능력만큼이나 안전성에 큰 영향을 미침을 확인했습니다.

주요 내용

  • 10,000개 이상의 검증된 상태 기반 시나리오를 제공하는 OpenART 프레임워크 개발
  • 환경 상태를 변화시켜 취약점을 찾는 피드백 기반 블랙박스 공격 정책(EMHA) 제안
  • 작업 복잡도가 증가할수록 환경 진화 기반 공격이 더 효과적임을 입증

실무에서 볼 만한 점

에이전트가 도구(Tool)를 사용하며 상태를 변경하는 실무 환경에서, 단순 프롬프트 공격이 아닌 '상태 변화'를 통한 보안 위협을 예측하고 방어하는 데 중요합니다.

참고할 행동

  • 에이전트 워크플로우 내 누적되는 상태 변화가 보안에 미치는 영향 분석
  • 단순 지시문 변경이 아닌 환경 변수 조작을 통한 레드팀 시나리오 설계
  • 에이전트 런타임 구현(Runtime) 단계에서의 보안 격리 정책 검토