Omni-IO Skills: 범용 에이전트에 멀티모달 실행 능력 더하기
배경
범용 AI 에이전트는 장기적인 계획과 추론, 실행에서 빠르게 발전하고 있다. 하지만 오디오, 비디오, 3D, 문서 등을 함께 다루는 제작 작업은 여전히 여러 전문 모델과 외부 도구에 의존한다. 문제는 도구를 호출하는 것만이 아니다. 어떤 기능을 선택할지, 작업 간 의존성을 어떻게 관리할지, 중간 산출물을 다음 단계와 다음 대화에서 어떻게 재사용할지까지 조정해야 한다.
Omni-IO Skills는 이 문제를 기존 에이전트 바깥에 배치하는 플러그인형 Agent Harness로 해결하려 한다. 에이전트의 추론 및 계획 기능을 교체하는 대신, 에이전트가 만든 계획을 실행 가능한 멀티모달 작업 흐름으로 변환하는 계층을 제공한다.
핵심 구성
- 계층형 Skills: 27개 Skills가 38개 대표 작업을 지원한다. 범위는 7개 산출물 모달리티와 이해, 생성, 추론, 검색의 4개 능력군이다. 서로 다른 모델과 도구를 에이전트가 사용할 수 있는 일관된 실행 인터페이스로 묶는 방식이다.
- 선언적 실행 그래프: 여러 산출물을 만드는 과정을 의존성 그래프로 표현한다. 서로 독립적인 작업은 병렬로 실행하고, 하위 작업은 필요한 상위 산출물이 준비된 뒤 시작한다. 예를 들어 비디오를 분석하고, 배경음악을 만들고, 표지 이미지가 포함된 슬라이드로 변환하는 흐름을 하나의 그래프로 구성할 수 있다.
- 지속형 Asset Registry: 성공적으로 생성된 중간 파일을 등록해 후속 작업과 이후 대화에서 다시 사용한다. 도구의 결과를 일회성 응답으로 끝내지 않고, 추적 가능한 작업 자산으로 관리하는 점이 특징이다.
- 교체 가능한 백엔드: 실제 실행 서비스와 에이전트 인터페이스를 분리한다. 논문에 따르면 공급자 변경은 주로 설정 변경으로 처리할 수 있어 특정 도구에 대한 종속을 줄인다.
평가 결과
UniM-90에서 Harness를 적용한 뒤 GPT-5.6 Sol의 입력 지원률은 40.00%에서 100%로, Claude Sonnet 5는 38.89%에서 100%로 올랐다. Semantic–Quality Coupled Score는 각각 26.99에서 74.94, 27.82에서 77.78로 개선됐다. Strict Structure Score는 GPT-5.6 Sol에서 100.00, Claude Sonnet 5에서 99.78을 기록했다.
이 결과는 에이전트의 실제 멀티모달 작업 범위가 모델 자체의 능력뿐 아니라 도구 연결 방식과 실행 오케스트레이션에 의해서도 제한될 수 있음을 보여준다. 다만 이 시스템이 모델 자체에 새로운 모달리티 능력을 내재화했다는 의미는 아니다. 결과 품질은 외부 실행 백엔드, 도구의 안정성, 의존성 계획의 정확성에 계속 영향을 받는다.
의미와 전망
Omni-IO Skills는 모델과 실행 시스템의 역할을 분리한다. 호스트 모델은 사용자의 의도를 이해하고 계획을 세우며, Harness는 그 계획을 병렬 실행과 재사용이 가능한 산출물 워크플로로 변환한다. 새로운 도구가 추가될 때마다 파운데이션 모델을 수정하지 않고 Skills나 백엔드를 확장할 수 있다는 점이 핵심이다.
코드와 20개의 예시 워크플로도 공개돼 있어 멀티모달 에이전트의 Skill 조합, 중간 자산 관리, 백엔드 교체 방식을 직접 검토할 수 있다. 장기 작업을 수행하는 에이전트에서는 추론 능력만큼이나 의존성과 산출물을 안정적으로 보존하는 실행 인프라가 중요해질 가능성이 크다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…