EngiWorld가 보여준 엔지니어링 AI의 현재 수준
들어가며
화면의 버튼을 클릭하고, 양식을 작성하고, 스크립트를 실행하는 능력은 컴퓨터 사용 에이전트의 중요한 진전이다. 그러나 전문 엔지니어링 소프트웨어에서 요구되는 능력은 단순한 인터페이스 조작보다 훨씬 복잡하다. 설계 과정에는 형상 관계, 물리적 제약, 제조 규칙, 파일 형식, 그리고 여러 단계에 걸쳐 유지되어야 하는 의존성이 포함된다. EngiWorld는 에이전트가 이 전체 설계 루프를 수행해 실제로 사용할 수 있는 결과물을 만드는지를 측정하려는 벤치마크다.
무엇을 평가하나
- 6개 엔지니어링 분야: CAD, CAE, CAM, BIM, EDA, 3D 시각화를 하나의 평가 체계로 다룬다.
- 26개 전문 플랫폼: 그래픽 사용자 인터페이스뿐 아니라 명령줄 인터페이스를 사용하는 작업도 포함한다.
- 1301개 전문가 큐레이션 과제: 소프트웨어 선택부터 개방형 설계 과제까지 6가지 유형을 구성했다.
- 산출물 중심 평가: 에이전트가 정해진 클릭 순서를 끝냈는지가 아니라, 최종 및 중간 산출물 자체를 검사한다. 통합 검증 도구는 기하학적 유효성, 물리적 실현 가능성, 관련 규칙 준수 여부를 확인한다. 정량적 과제는 성공과 실패의 이분법 대신 요구사항을 얼마나 충족했는지에 따라 연속 점수를 받는다.
결과가 말하는 것
7개 최첨단 모델을 평가한 결과, 가장 높은 EngiScore는 44.3이었다. 여러 소프트웨어를 함께 사용해야 하는 시도에서 성공한 비율은 3.6%에 불과했다. 이는 현재의 핵심 문제가 전문 애플리케이션의 화면 배치를 익히는 데만 있지 않다는 뜻이다. 에이전트는 파라미터를 바꿔도 설계 의도를 유지하고, 도구 사이에서 정보를 전달하며, 겉보기에는 완성됐지만 실제로는 부적절한 결과물을 찾아내야 한다.
엔지니어링 산출물은 서로 연결된 시스템이다. 그럴듯한 형상을 만들더라도 기하학적 제약을 위반할 수 있고, 시뮬레이션을 설정하더라도 물리적으로 적합하지 않을 수 있다. 한 소프트웨어에서 만든 파일이 다음 제조나 문서화 단계에서 사용되지 못하는 경우도 있다. 따라서 결과물 자체를 검증하는 방식은 화면 조작 중심의 평가가 놓칠 수 있는 실패를 드러낸다.
산업적 의미
EngiWorld의 의의는 AI의 진전을 “작업을 수행했는가”가 아니라 “설계 사양을 얼마나 충족했는가”로 평가한다는 데 있다. 연구자들은 이를 바탕으로 장기 계획, 도구 호출, 검증, 소프트웨어 간 상태 관리 능력을 개선할 수 있다. 기업 입장에서는 당장 에이전트를 설계 탐색, 파라미터 변경, 소프트웨어 선택, 검증 보조에 활용할 여지가 있다. 하지만 현재 결과만으로 전체 납품 과정을 자율적으로 맡길 수준이라고 보기는 어렵다.
이 점수는 모든 실제 엔지니어링 역량을 대표하지 않으며, 과제 범위와 소프트웨어 버전, 검증 규칙의 영향도 받는다. 그럼에도 이번 결과는 방향을 분명히 보여준다. 전문 소프트웨어를 조작하는 단계에서 신뢰할 수 있는 엔지니어링 결과물을 납품하는 단계로 나아가려면, 제약 조건 추론, 장기 계획, 도구 간 상태 기억, 산출물 검증이 모두 더 강해져야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…