記事一覧へ戻る
AIエージェント

CompoWorld、複数サービスをまたぐAIエージェント訓練を実現

読了目安 3 分

背景

現実の業務を自動化するエージェントは、通常ひとつのアプリだけを操作するわけではない。あるサービスから情報を取得し、その結果を別のサービスで加工・登録し、さらに次のツールで処理する、といった連続した流れが必要になる。ところが、既存の自動生成環境は単一環境内のタスクに重点を置くことが多い。CompoWorldは、この断絶を埋めるための環境スケーリング手法である。

仕組みの要点

CompoWorldは、タスクごとに新しい世界を作るのではなく、再利用可能なサービスを蓄積し、それらを組み合わせて新しいワークフローを作る。

  • 検証可能なサービス:コーディングエージェントがツール仕様からサービスを実装し、型付き状態と共通インターフェースを付与する。これにより、サービス同士を接続しやすく、状態遷移も確認しやすくなる。
  • 世界モデルによる補完:安定した実装が難しいツールについては、世界モデルがインタラクションを担う。すべての外部システムを完全に再現する必要を減らす設計だ。
  • 依存関係に基づく生成:ランダムウォークによってサービス間の依存関係グラフを作る。エージェントは複数のツールを呼ぶだけでなく、途中の情報を保持し、変換し、後続サービスで正しく利用しなければならない。
  • 完了重視の学習:検証済みの軌跡を教師あり微調整に利用し、強化学習ではCompletion-Focused Rubric Rewardを使う。各ロールアウト群で合格率の低い評価基準を重視することで、簡単な部分だけをこなすのではなく、ワークフロー全体の完了を促す。

研究チームは448のサービスと10,130のツールを構築し、3K件の教師あり微調整用軌跡と1K件の強化学習タスクでQwen3.6-35B-A3Bを訓練した。論文概要によれば、8つのベンチマークで基盤モデルを平均9.17ポイント上回った。またAutomationBenchでは、Claude Opus 4.6を含むフロンティアモデルを上回り、比較対象のエージェント特化型35B-A3Bモデルの中でも首位になったとされる。

意義と課題

CompoWorldの重要性は、環境の規模を単一アプリ内のタスク数だけで捉えず、サービスの組み合わせと依存構造の数まで広げた点にある。明確なインターフェースと検証可能な状態を持つサービスがあれば、限られた部品から多様な長期タスクを生成できる。

これは、情報の受け渡し、ツールの連携、最後までやり切る能力を学習させたい場合に有効な方向性だ。一方で、生成されたサービスの品質、世界モデルの正確性、自動検証の範囲に性能が左右される。今回のベンチマーク結果だけで、公開ウェブ環境や実際の権限管理、高リスク業務での信頼性まで証明されたとは言えない。今後は実装の詳細と第三者による再現検証が重要になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LongCat-DeepResearchが示す、協調型マルチエージェント研究の設計
AIエージェント
cctest.ai
AIエージェント

LongCat-DeepResearchが示す、協調型マルチエージェント研究の設計

LongCat-DeepResearchは、強化されたLongCatモデルとマルチエージェント型ワークフローを組み合わせ、根拠に基づく調査レポートの作成を目指す。評価結果は有望だが、計画を増やせば常に品質が上がるわけではないことも示された。

続きを読む
CCTest · Blog
Raven:進化するエージェント・ハーネスを組み合わせる仕組み
AIエージェント
cctest.ai
AIエージェント

Raven:進化するエージェント・ハーネスを組み合わせる仕組み

Ravenは、モデルや領域ごとの専用ハーネスを自動で構築・改善し、それらを組み合わせる「ハーネスのハーネス」を提案します。長期かつ領域横断的な作業を、単一エージェントの能力ではなく、複数の能力単位の協調として捉え直す試みです。

続きを読む
CCTest · Blog
HybridCUA、GUIとCLIを使い分けるコンピュータ操作エージェントを学習
AIエージェント
cctest.ai
AIエージェント

HybridCUA、GUIとCLIを使い分けるコンピュータ操作エージェントを学習

HybridCUAは、グラフィカルインターフェースとコマンドラインを組み合わせ、タスクに応じて両者を使い分けるコンピュータ操作エージェントの学習手法を提案する。9BモデルはOSWorldで53.6%の精度を達成し、ベースモデルを14.8ポイント上回った。

続きを読む