CompoWorld、複数サービスをまたぐAIエージェント訓練を実現
背景
現実の業務を自動化するエージェントは、通常ひとつのアプリだけを操作するわけではない。あるサービスから情報を取得し、その結果を別のサービスで加工・登録し、さらに次のツールで処理する、といった連続した流れが必要になる。ところが、既存の自動生成環境は単一環境内のタスクに重点を置くことが多い。CompoWorldは、この断絶を埋めるための環境スケーリング手法である。
仕組みの要点
CompoWorldは、タスクごとに新しい世界を作るのではなく、再利用可能なサービスを蓄積し、それらを組み合わせて新しいワークフローを作る。
- 検証可能なサービス:コーディングエージェントがツール仕様からサービスを実装し、型付き状態と共通インターフェースを付与する。これにより、サービス同士を接続しやすく、状態遷移も確認しやすくなる。
- 世界モデルによる補完:安定した実装が難しいツールについては、世界モデルがインタラクションを担う。すべての外部システムを完全に再現する必要を減らす設計だ。
- 依存関係に基づく生成:ランダムウォークによってサービス間の依存関係グラフを作る。エージェントは複数のツールを呼ぶだけでなく、途中の情報を保持し、変換し、後続サービスで正しく利用しなければならない。
- 完了重視の学習:検証済みの軌跡を教師あり微調整に利用し、強化学習ではCompletion-Focused Rubric Rewardを使う。各ロールアウト群で合格率の低い評価基準を重視することで、簡単な部分だけをこなすのではなく、ワークフロー全体の完了を促す。
研究チームは448のサービスと10,130のツールを構築し、3K件の教師あり微調整用軌跡と1K件の強化学習タスクでQwen3.6-35B-A3Bを訓練した。論文概要によれば、8つのベンチマークで基盤モデルを平均9.17ポイント上回った。またAutomationBenchでは、Claude Opus 4.6を含むフロンティアモデルを上回り、比較対象のエージェント特化型35B-A3Bモデルの中でも首位になったとされる。
意義と課題
CompoWorldの重要性は、環境の規模を単一アプリ内のタスク数だけで捉えず、サービスの組み合わせと依存構造の数まで広げた点にある。明確なインターフェースと検証可能な状態を持つサービスがあれば、限られた部品から多様な長期タスクを生成できる。
これは、情報の受け渡し、ツールの連携、最後までやり切る能力を学習させたい場合に有効な方向性だ。一方で、生成されたサービスの品質、世界モデルの正確性、自動検証の範囲に性能が左右される。今回のベンチマーク結果だけで、公開ウェブ環境や実際の権限管理、高リスク業務での信頼性まで証明されたとは言えない。今後は実装の詳細と第三者による再現検証が重要になる。
コメント
ログイン状態を確認中…
コメントを読み込み中…