아티클 목록으로
AI 에이전트

LEGO-Anything: 코딩 에이전트가 한 장의 이미지를 편집 가능한 3D 장면으로

약 3분 소요

들어가며

단일 이미지에서 3D 장면을 복원하는 시스템은 보통 메시나 포인트 클라우드, 또는 최종 렌더링 이미지를 출력한다. 그러나 실제 활용에서는 결과를 다시 살펴보고 수정하거나, 장면 속 정보를 다른 작업에서 질의할 수 있어야 한다. LEGO-Anything은 이 목표를 위해 고정된 3D 출력 대신 실행 가능한 장면 프로그램을 생성하는 접근을 제안한다.

이미지에서 Blender 코드로

LEGO-Anything은 Image-to-Code 프레임워크다. 코딩 에이전트는 입력 이미지를 바탕으로 Blender 코드를 작성하고 실행한 뒤, 생성된 장면과 렌더링을 확인한다. 이후 관찰한 결과에 따라 프로그램을 수정하고 다시 실행한다. 따라서 최종 산출물은 한 번 만들어지고 끝나는 모델이 아니라, 재실행하고 편집할 수 있는 장면 프로그램이다.

이 과정은 시각적 이해, 기하 구성, 프로그램 디버깅을 하나의 반복 루프로 결합한다. 동시에 에이전트 기반 복원의 취약점도 드러낸다.

  • 약한 초기화: 첫 장면의 기본 구조가 부실하면 이후 수정만으로 회복하기 어렵다.
  • 반복 편집에 따른 퇴행: 새로 적용한 변경이 이전에 잘 맞던 부분을 훼손할 수 있다.
  • 불안정한 자기평가: 에이전트가 렌더링을 평가한 결과가 실제 기하와 외관의 품질을 항상 반영하지는 않는다.

실패 유형을 나누는 LEGO-Bench

연구팀은 104개의 다양한 실내·실외 장면에서 얻은 208개 이미지를 포함하는 LEGO-Bench를 제시했다. 이 벤치마크는 장면 파일이 유효하게 작동하는지, 보이는 표면의 기하가 기준 장면과 가까운지, 렌더링 외관이 일치하는지를 따로 측정한다. 하나의 유사도 점수만 사용할 때보다, 실행 가능한 결과와 실제로 충실한 복원을 구분하기 쉽다.

평가된 에이전트 가운데 GPT-6-astra가 가장 높은 종합 성능을 보였으며, 실내 점수는 53.4%, 실외 점수는 39.6%였다. 하지만 유효한 장면 산출과 기하·외관의 정확한 복원 사이에는 여전히 큰 간극이 있었다. 즉 프로그램이 실행된다는 사실만으로 복원이 정확하다고 보기는 어렵다.

반복 작업을 통제하는 LEGO-Plugin

LEGO-Plugin은 추가 학습 없이 에이전트의 장면 제작 과정을 더 체계적으로 관리하는 하네스 플러그인이다. 42개 사례로 구성된 Office 부분집합에서 테스트한 6개 모델 모두의 성능을 높였고, 종합 점수의 상대적 향상 폭은 최대 62.7%였다. 이는 더 큰 모델을 사용하는 것뿐 아니라 상태 보존, 변경 관리, 피드백 구성 같은 작업 흐름도 결과에 큰 영향을 준다는 점을 보여준다.

장면 프로그램을 시각 인터페이스로

LEGO-World에서는 GPT-6-astra가 복원한 장면을 이용해 객체 검출, 인스턴스 분할, 상대 깊이를 결정론적으로 질의했다. 세 작업 모두 일정 수준의 성능을 보였지만, 전문 비전 모델에는 크게 미치지 못했다. 따라서 현재의 결과는 자연 이미지를 정밀하게 표현하는 완성된 세계 모델이라기보다, 이미지와 프로그래밍 가능한 3D 환경을 연결하는 유망한 중간 표현으로 보는 편이 타당하다.

의미와 한계

LEGO-Anything의 핵심 의미는 이미지 이해, 코드 생성, 상호작용 가능한 3D 환경을 하나의 루프에 연결했다는 데 있다. 시뮬레이션, 편집 가능한 콘텐츠 제작, 구조화된 공간 정보를 필요로 하는 에이전트에 활용될 가능성이 있다. 그러나 한 장의 이미지에는 가려진 영역과 깊이의 모호성이 존재하며, 반복 수정 과정에서 오류가 누적될 수 있다. 앞으로는 더 나은 초기화, 되돌릴 수 있는 편집, 신뢰도 높은 자동평가가 중요해질 것이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법
AI 에이전트
cctest.ai
AI 에이전트

검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법

자가 진화 검색 에이전트는 서로의 같은 오류를 정답처럼 강화해 내부 보상만 높일 수 있다. CrossFit은 학습 데이터와 평가 경로의 출처를 분리해 이런 피드백 고리를 약화한다.

더 보기
CCTest · Blog
PatchHolmes, 리스트 비교 에이전트로 취약점 수정 커밋을 찾다
AI 에이전트
cctest.ai
AI 에이전트

PatchHolmes, 리스트 비교 에이전트로 취약점 수정 커밋을 찾다

PatchHolmes는 하이브리드 검색으로 후보를 좁힌 뒤 에이전트가 후보 목록 전체를 비교하도록 해 실제 취약점 수정 커밋을 선택한다. 개별 후보를 따로 판정하는 방식보다 높은 Top-1 검색 성능을 더 적은 대화 횟수로 달성했다.

더 보기