아티클 목록으로
AI 에이전트

Procedura: 편집 가능한 3D 조립 프로그램을 만드는 에이전트

약 3분 소요

들어가며

단일 이미지에서 3D 형상을 복원하는 생성 모델은 전체적인 외형을 그럴듯하게 만드는 데 상당한 성과를 냈다. 하지만 기계 부품이나 도구처럼 하드서피스 특성이 중요한 대상에서는 외관의 유사성만으로 부족하다. 조밀한 메시에는 가공품에 필요한 날카로운 모서리가 약하게 나타날 수 있고, 부품 분해 구조나 사용자가 수정할 수 있는 치수 파라미터도 노출되지 않는다.

Procedura는 3D 형상을 코드로 다루는 방식으로 이 문제에 접근한다. 모델이 최종 메시를 한 번에 추측하도록 하는 대신, LLM 기반 에이전트가 파라미터화된 조립 프로그램을 단계적으로 작성한다.

핵심 방식

  • 조립 그래프를 먼저 계획: 텍스트 요구사항을 이름이 있는 부품과 부품 사이의 관계로 나눈다.
  • 구속 조건으로 위치를 계산: 부품은 타입이 지정되고 기계적으로 검증 가능한 mate로 연결되며, 위치는 결합된 좌표 프레임에서 계산된다.
  • 단계별 구조 검증: 새 부품은 컴파일, mate, 연결성 검사를 모두 통과한 뒤에만 결과에 추가된다.
  • 비전 비평기를 분리: 별도의 비전 모듈이 문제를 진단하고 한 번에 하나의 수정 사항을 적용한다.
  • 재질과 움직임을 함께 표현: 조립 그래프에 부품별 재질을 담을 수 있으며, 관절 운동은 시뮬레이터로 검증할 수 있다.

의미와 영향

가장 중요한 변화는 3D 생성의 결과 표현이다. 기존 생성기는 완성된 외관을 가진 메시를 만드는 데 집중하는 경우가 많다. 반면 Procedura는 부품, 치수, 배치, 연결 방식을 설명하는 프로그램 자체를 만들려고 한다. 이런 표현은 CAD 설계, 로봇 시뮬레이션, 게임 에셋, 제조 지향 설계와 더 잘 맞는다. 사용자는 이후 파라미터를 바꾸거나 부품을 교체하고, 조립 관계를 점검할 수 있다.

이 프레임워크는 언어 모델과 기하학 도구의 역할도 나눈다. 에이전트는 요구사항을 해석하고 구조를 계획하며 코드를 작성한다. 컴파일러와 조립 검사기는 프로그램이 실제로 성립하는지, 연결 관계가 유효한지를 확인한다. 비전 비평기는 외형상의 문제를 다룬다. 명확한 위상과 기계적 관계가 필요한 대상에서는 이미지 유사도만 사용하는 방식보다 이런 조합이 더 적합할 수 있다.

평가에서 연구진은 P3D-Bench의 조립 판정기를 사용했고, 하드서피스 벤치마크인 MechBench-36에도 같은 판정 방식을 적용했다. 논문 초록은 두 평가 모두에서 Procedura가 네이티브 3D 생성기와 기존 3D 코드 에이전트보다 높은 결과를 냈다고 설명한다. 테스트한 방법 가운데 가장 날카로운 모서리를 생성했다는 점도 제시한다. 무엇보다 독특한 부분은 편집 가능한 부품 구조 프로그램을 출력한다는 것이다.

물론 복잡한 물체를 안정적으로 분해하는 일, 구속 조건을 설계하는 일, 시각적 오류를 진단하는 일, 실제 모델링 커널과 호환하는 일은 여전히 과제다. 그럼에도 Procedura는 3D 에이전트가 단순히 그럴듯한 모델을 만드는 수준을 넘어, 사람이 계속 수정할 수 있는 설계를 구성하고 검증하며 유지하는 방향으로 발전할 가능성을 보여준다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PILOT, 장기 에이전트에 실행 중 실시간 교정과 자기 진화를 도입
AI 에이전트
cctest.ai
AI 에이전트

PILOT, 장기 에이전트에 실행 중 실시간 교정과 자기 진화를 도입

PILOT은 에이전트의 자기 개선을 작업 종료 후 분석에서 실행 중 제어로 확장하는 감독자-작업자 하니스를 제안한다. 별도의 감독자는 실행 중인 작업자를 전환하거나 중단할 수 있고, 실행 중 얻은 교훈은 재사용 가능한 기술과 메모리로 축적된다.

더 보기
CCTest · Blog
WikiSkill: 에이전트 경험을 지속 지식으로 바꿔 스킬을 진화시키다
AI 에이전트
cctest.ai
AI 에이전트

WikiSkill: 에이전트 경험을 지속 지식으로 바꿔 스킬을 진화시키다

WikiSkill은 에이전트의 실행 경험, 지속 가능한 위키형 지식베이스, 실행 가능한 스킬을 분리한 뒤 함께 진화시키는 프레임워크다. 여러 모델에서 성능 향상을 보였으며 모델 간 스킬 이전 가능성도 제시했다.

더 보기