아티클 목록으로
모델 평가

CADWorld, AI 에이전트의 장기 CAD 작업 능력을 검증하다

약 4분 소요

들어가며

컴퓨터 사용 에이전트는 검색이나 문서 입력을 넘어 실제 데스크톱 환경에서 전문 소프트웨어를 다루는 능력까지 평가받고 있습니다. 하지만 CAD와 같은 엔지니어링 도구에서는 화면에 그럴듯한 결과가 나타나는 것만으로는 충분하지 않습니다. 작업이 끝난 뒤에도 원본 프로젝트가 저장되어 있어야 하고, 다시 열어 수정할 수 있어야 하며, 치수와 제약 조건, 모델 구조, 후속 엔지니어링 상태가 요구사항에 맞아야 합니다.

CADWorld는 이러한 기준을 장기 컴퓨터 사용 평가에 적용한 벤치마크입니다. 오픈소스 CAD 소프트웨어인 FreeCAD를 대상으로, 단순한 클릭이 아니라 여러 단계가 연결된 기계 CAD 워크플로를 측정합니다.

핵심 내용

  • 11개 작업 범위를 포함합니다. 총 200개 작업은 스케치, 부품 모델링, 조립, CAM, 유한요소해석, 측정, 메시 처리, 기술 도면 등을 다룹니다.
  • 스크린샷과 GUI 동작으로 수행합니다. 에이전트는 화면을 관찰하고 그래픽 인터페이스를 조작하면서, 앞선 행동이 바꾼 애플리케이션 상태를 계속 추적해야 합니다.
  • 최종 산출물을 실행 가능한 검사로 평가합니다. 저장된 FreeCAD 프로젝트와 보조 출력물을 대상으로 형상 속성, 파라메트릭 구조, 제약 조건, 제조 상태, 시뮬레이션 결과 등을 작업별로 확인합니다.
  • 전문가와 큰 성능 차이가 있습니다. 7개 최신 에이전트를 전체 벤치마크에서 평가한 결과, 가장 높은 성공률은 17.5%였습니다. 전문가 참조 통과율은 87.0%였습니다.

CAD가 더 어려운 이유

기계 CAD의 각 단계는 서로 강하게 연결됩니다. 스케치의 제약 조건 하나가 빠지거나 잘못 설정되면 이후의 돌출, 절삭, 필렛과 같은 피처에 영향을 줄 수 있습니다. 최종 모양이 비슷하더라도 치수가 다르거나, 피처 트리의 구조와 생성 순서가 요구사항과 다르면 유효한 설계 결과로 인정되지 않을 수 있습니다. 조립 관계, 제조 설정, 측정값, 해석 결과 역시 화면만 보고는 쉽게 확인하기 어려운 내부 상태입니다.

따라서 CADWorld는 화면 이미지의 유사성만 비교하는 평가와 다릅니다. 에이전트는 인터페이스의 현재 상태뿐 아니라 행동 이력, 매개변수 관계, 피처 구조, 저장 파일을 일관되게 관리해야 합니다. 오류가 발생했을 때도 단순히 이전 단계로 되돌리는 것만으로는 부족할 수 있습니다. 의존 관계를 찾아 피처를 다시 만들거나 제약 조건을 재설정해야 하기 때문입니다.

실험 결과는 이런 차이를 분명하게 보여줍니다. 약한 에이전트는 유효한 산출물을 만들기 전에 실패하는 경우가 많았습니다. 더 강한 에이전트는 프로젝트 파일을 남길 가능성이 높아졌지만, 구조적 요구사항과 기하학적 조건, 생성 과정의 규칙에서 계속 실패했습니다. GUI 조작 능력이 높아진다고 해서 엔지니어링 작업을 안정적으로 완료할 수 있는 것은 아니라는 의미입니다.

의미와 영향

CADWorld는 일반적인 컴퓨터 사용 능력과 전문적인 자동화 능력 사이의 간극을 측정할 수 있는 현실적인 기준을 제공합니다. 앞으로의 에이전트는 버튼과 메뉴를 정확히 찾는 것뿐 아니라 파라메트릭 모델링을 이해하고, 긴 행동 순서를 계획하며, 중요한 단계마다 프로젝트 상태를 검증해야 합니다.

연구자에게는 조작 실패와 산출물 실패를 구분할 수 있다는 점이 중요합니다. 실무에서 신뢰받으려면 에이전트가 만든 결과는 원본 형식이어야 하고, 검사 가능하며, 구조적으로 올바르고, 이후 편집이나 분석에 넘길 수 있어야 합니다. CADWorld의 낮은 성공률은 GUI 에이전트의 발전을 부정하는 결론이라기보다, 소프트웨어를 조작하는 단계에서 신뢰할 수 있는 설계 결과를 만드는 단계까지의 거리를 수치로 드러낸 결과입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
BI-Agent와 BI-Bench가 제시한 엔드투엔드 비즈니스 인텔리전스 자동화
모델 평가
cctest.ai
모델 평가

BI-Agent와 BI-Bench가 제시한 엔드투엔드 비즈니스 인텔리전스 자동화

새 연구에 따르면 최첨단 대규모 언어 모델도 실제에 가까운 BI 작업에서 정확도 50% 미만을 기록했습니다. 연구진은 데이터 검색부터 변환, 조인, 질의 응답까지 평가하는 BI-Bench와 도구 증강형 BI-Agent를 제안했습니다.

더 보기
CCTest · Blog
APort Vault, AI 에이전트 결제 권한의 경계를 검증하다
모델 평가
cctest.ai
모델 평가

APort Vault, AI 에이전트 결제 권한의 경계를 검증하다

APort Vault는 도구를 사용하는 AI 에이전트가 결제 요청과 승인된 결제 실행을 구분하는지 평가하는 벤치마크다. Open Agent Passport 기반의 결정적 사전 검사를 적용하자 허용되지 않은 수취인으로의 송금은 비교 조건에서 140건에서 0건으로 줄었다.

더 보기
CCTest · Blog
AI가 AI 심사자를 학습시키면 과학적 판단은 어떻게 무너지는가
모델 평가
cctest.ai
모델 평가

AI가 AI 심사자를 학습시키면 과학적 판단은 어떻게 무너지는가

모델이 생성한 동료평가를 다음 세대 AI 심사자가 학습하면 평가 점수의 분포와 의미적 다양성이 축소될 수 있다는 연구가 나왔다. 연구진은 이를 ‘과학적 판단 붕괴’로 부르고 TrustReviewer를 통한 완화책을 제시했다.

더 보기