MaLiang-Harness, 실행 가능한 코드를 시각적 완성도로 연결하다
들어가며
프로그램 기반 이미지·동영상 생성은 장면 구성과 움직임을 보다 명시적으로 제어할 수 있는 방법입니다. 하지만 코드가 오류 없이 실행됐다는 사실만으로 결과가 완성됐다고 보기는 어렵습니다. 객체의 배치가 틀릴 수 있고, 요청한 외관이 반영되지 않을 수 있으며, 동영상의 움직임이나 시간적 흐름이 지시와 어긋날 수도 있습니다. MaLiang-Harness는 이런 문제를 ‘프로그램-시각(Program-to-Visual, P2V) 간극’으로 정의하고, 시각 생성을 일회성 코드 작성이 아닌 지속적인 개선 과정으로 다룹니다.
핵심 설계
- 실행 가능한 상태를 유지한다. Persistent Executable Generation(PEG)은 변화하는 시각 프로그램과 작업 맥락을 보존합니다. 모델은 매번 처음부터 다시 작성하지 않고 이전 버전에서 작업을 이어갈 수 있습니다.
- 수정과 렌더링 결과를 연결한다. Traceable Generation Process(TGP)는 프로그램 편집을 렌더링된 증거와 연결합니다. 이를 통해 특정 수정이 화면에 어떤 변화를 만들었는지 추적할 수 있습니다.
- 현재 버전을 기준으로 검증한다. Revision-aware Editing and Verification(REV)은 이전 상태로 되돌리는 기능을 지원하고, 완료 전에 현재 수정본을 점검합니다. 과거에 실행됐다는 사실보다 현재 결과가 요구사항을 충족하는지가 중요하다는 접근입니다.
- 계획과 피드백을 하나의 루프로 묶는다. 계획 수립, 실행, 렌더링, 시각적 피드백, 재편집을 여러 렌더링 백엔드에 걸쳐 하나의 흐름으로 조정합니다.
평가 결과
연구진은 이미지용 MaLiang-IBench와 동영상용 MaLiang-VBench를 사용해 생성 성공률, 시각 품질, 계산 비용을 측정했습니다. 이미지 과제에서는 11개의 폐쇄형 멀티모달 대규모 언어 모델을, 동영상 과제에서는 4개 모델을 평가했습니다. 제공된 논문 요약에 따르면 GPT-6-Astra는 두 벤치마크 모두에서 생성 성공률 100%를 기록했습니다. 모든 품질 기준을 충족한 비율은 이미지 과제에서 96.0%, 동영상 과제에서 76.9%였습니다.
이 결과가 보여주는 핵심은 실행 가능한 코드를 생성하는 능력과 시각적 요구사항을 만족하는 능력이 동일하지 않다는 점입니다. 연구는 또한 일반적인 모델 능력 점수가 비슷한 모델 사이에서도 프로그램을 실제 시각 결과로 변환하는 성능에 큰 차이가 나타날 수 있다고 설명합니다.
의미와 한계
MaLiang-Harness는 새로운 코드 생성 모델이라기보다, 시각 생성 작업을 구성하고 평가하기 위한 프레임워크에 가깝습니다. 발전 중인 프로그램, 수정 기록, 렌더링 결과를 동일한 버전 참조 아래에 두면서 모델이 시각적 오류를 발견하고, 유효한 수정을 보존하며, 결과를 반복적으로 개선하는지를 분석할 수 있게 합니다.
이는 멀티모달 모델 평가 방식에도 시사점을 줍니다. 앞으로는 모델이 코드를 작성할 수 있는지만 볼 것이 아니라, 결과를 검사하고, 요구사항과의 차이를 찾아내며, 올바른 버전을 수정할 수 있는지도 측정해야 합니다. 제공된 자료만으로 모든 렌더러나 오픈 모델에서의 일반화 가능성을 확정할 수는 없습니다. 그럼에도 MaLiang-Harness는 ‘생성-검사-수정’ 과정을 재현 가능하고 측정 가능한 엔지니어링 루프로 만드는 방향을 제시합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…