EngiWorld: What Can Frontier Agents Deliver in Professional Engineering Environments?
전문 엔지니어링 워크플로우 자동화를 위한 최초의 엔드투엔드 벤치마크 및 평가 프레임워크 제안
논문이 다루는 내용
범용 AI 에이전트의 발전에도 불구하고, 기하학적·물리적 제약 조건이 복잡하게 얽힌 전문 엔지니어링 자동화는 여전히 어려운 과제로 남아 있습니다. 본 논문은 CAD, CAE, BIM 등 6개 도메인과 26개 소프트웨어를 아우르는 1,301개의 전문가 큐레이션 태스크를 포함한 EngiWorld 벤치마크를 제안합니다. 평가 방식은 단순 성공 여부를 넘어, 통합 도메인 검증기를 통해 결과물의 기하학적 타당성과 물리적 실현 가능성을 정밀하게 측정하는 아티팩트 중심 방법론을 사용합니다. 최신 프론티어 모델들을 테스트한 결과, 모델 간 성능 격차가 크며 다중 소프트웨어 활용 성공률은 매우 낮음을 확인했습니다. EngiWorld는 전문 엔지니어링 소프트웨어를 운용하는 에이전트 개발을 위한 엄격한 기초를 제공합니다.
핵심 결과
-
6개 엔지니어링 도메인 및 26개 전문 소프트웨어를 포괄하는 1,301개 태스크 벤치마크 구축
-
기하학적 타당성 및 물리적 제약을 검증하는 아티팩트 중심의 정밀 평가 방법론 도입
-
단순 성공/실패가 아닌 사양 달성도에 기반한 연속적 점수 산출 방식 적용
실무에서 볼 만한 점
에이전트가 단순 텍스트 생성을 넘어 물리적/기하학적 제약이 있는 복잡한 소프트웨어 도구를 다루는 능력을 측정하는 기준을 제시합니다.
읽을 때 확인할 점
-
제시된 6개 도메인(CAD, CAE 등) 중 특정 분야의 에이전트 성능 측정 실험
-
도메인 검증기(Domain-verifier)를 활용한 기존 에이전트의 결과물 정밀 검증
-
멀티 소프트웨어 워크플로우에서의 에이전트 추론 능력 비교 테스트