Omni-IO Skills:汎用エージェントをマルチモーダル化する実行基盤
概要
汎用エージェントは、長い手順の計画や推論、実行では大きく進歩している。しかし、音声、動画、3D、文書などを組み合わせた制作作業では、依然として複数の専門モデルや外部ツールに頼る場面が多い。ここで難しいのは単純なツール呼び出しではない。どの能力を選ぶか、処理の順序をどう決めるか、中間成果物をどう渡すか、次の対話でどう再利用するかまで管理する必要がある。
Omni-IO Skillsは、この課題を既存エージェントの外側に置くプラグイン型のAgent Harnessとして扱う。エージェントの推論・計画能力を置き換えるのではなく、それらの計画をマルチモーダルな実行ワークフローへ変換する役割を担う。
主な仕組み
- 階層型Skills:27個のSkillsで38種類の代表的タスクを扱う。対象は7種類の成果物モダリティと、理解、生成、推論、検索という4つの能力領域である。異なるツールを、エージェントから見て共通化されたインターフェースにまとめる。
- 宣言的な実行グラフ:複数の成果物を作る処理を、依存関係を持つグラフとして表現する。互いに依存しない処理は並列実行し、下流の処理は必要な上流成果物が完成してから開始する。動画を分析し、BGMを作り、表紙付きのスライドへ変換するといった流れに適している。
- 永続的なAsset Registry:正常に生成された中間ファイルを登録し、後続処理や次の対話で呼び出せるようにする。各ツールの結果を一時的なレスポンスにせず、ワークフロー上の管理可能な資産として扱う点が特徴だ。
- 交換可能なバックエンド:実際の実行サービスとエージェント側のインターフェースを分離する。論文では、プロバイダーの切り替えを設定変更で行える構成が示されている。
評価結果
UniM-90では、Harness導入後、GPT-5.6 Solの入力サポート率が40.00%から100%へ、Claude Sonnet 5が38.89%から100%へ上昇した。Semantic–Quality Coupled Scoreも、それぞれ26.99から74.94、27.82から77.78に改善している。Strict Structure ScoreはGPT-5.6 Solで100.00、Claude Sonnet 5で99.78に達した。
この結果は、エージェントの実用的なマルチモーダル対応範囲が、基盤モデルの能力だけでなく、ツールの接続方式や依存関係の管理にも左右されることを示している。一方で、これはモデル自体が新しいモダリティを内在的に獲得したという主張ではない。実行結果は外部バックエンドに依存し、ツールの品質や計画の正確さも重要になる。
意義
Omni-IO Skillsは、モデルと実行基盤の役割を分ける設計を提示する。モデルは意図の理解と計画を担い、Harnessは計画を並列化可能で再利用可能な成果物フローへ変換する。新しいツールが増えるたびに基盤モデルを更新するのではなく、Skillsやバックエンドを追加することで機能を拡張できる可能性がある。
コードと20個のサンプルワークフローも公開されており、マルチモーダルエージェントの技能合成や資産管理を検証するための実装例となる。長期的なエージェントでは、推論能力だけでなく、依存関係と中間成果物を保持する仕組みも中核的なインフラになりそうだ。
コメント
ログイン状態を確認中…
コメントを読み込み中…