記事一覧へ戻る
AIエージェント

Raven:進化するエージェント・ハーネスを組み合わせる仕組み

読了目安 3 分

導入

大規模言語モデルは、単発の質問応答から、長時間にわたる複雑なワークフローの実行へと用途を広げています。こうした作業では、モデルそのものだけでなく、ツール利用、計画、記憶、フィードバック、失敗からの復旧を含む周辺の仕組みが重要になります。Ravenはこの仕組みを「ハーネス」と捉え、領域ごとに手作業で複雑なハーネスを作り続けるのではなく、専用ハーネスを自動構築・改善し、組み合わせる方向を示します。

組み合わせ可能な知能単位

Ravenでは、実行可能なモデルとハーネスの組を、独立した知能のモジュールとして扱います。各モジュールは特定のモデル、領域、タスクに適応でき、上位の仕組みによって再編成されます。1つのエージェントにすべての能力を持たせる代わりに、大きな目標を分解し、適した専門エージェントへ委ねる設計です。

主な構成要素は次の通りです。

  • Host Agent:全体目標を理解し、サブタスクへの分解、担当エージェントの選択、依存関係の調整、結果の統合を行います。
  • Host Archive:過去のタスクで得た経験を保存し、後続の実行で参照できるようにします。
  • EverOS:タスクをまたいだ実行コンテキストと経験の管理を支えます。
  • Skill Forge:有効だった経験を再利用可能な手順やスキルへ変換します。

重要なのは、複数エージェントを並列に動かすだけではない点です。Ravenはハーネス自体を改善対象とし、成功した作業手順をスキルとして蓄積し、別のエージェントや将来のタスクで再利用することを目指します。

意義と残された課題

多くのエージェントシステムは、特定のモデル、ツールチェーン、領域を前提に最適化されています。狭い範囲では有効でも、領域横断型のワークフローでは、個別システムの維持費や汎用ハーネスの限界が問題になります。Ravenは、専門モジュールが領域適応を担い、Host Agentが全体調整を担うことで、この緊張関係に対応しようとします。

論文はまた、共有された資源予算の下で、複数の能力を組み合わせると信頼できるタスク範囲を拡大できる条件を理論的に論じています。これは、単体モデルの強さだけでなく、限られた資源で複数の不完全な能力をどう組織化するかに焦点を移す視点です。

一方、提供された素材は概要と全体的な性能向上の主張が中心で、評価ベンチマーク、資源条件、アブレーション、具体的な改善幅は示していません。自動生成されたハーネスの信頼性、調整コスト、エラーの伝播、経験検索の品質については、論文本文と公開コードによる検証が必要です。

Ravenは、「万能な1体」を作る発想から、相互運用可能なエージェントの生態系を構築する発想への転換といえます。その価値は、ハーネス生成の安定性、スキルのタスク間移転、そして協調の利益が追加コストを上回るかどうかで決まるでしょう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LongCat-DeepResearchが示す、協調型マルチエージェント研究の設計
AIエージェント
cctest.ai
AIエージェント

LongCat-DeepResearchが示す、協調型マルチエージェント研究の設計

LongCat-DeepResearchは、強化されたLongCatモデルとマルチエージェント型ワークフローを組み合わせ、根拠に基づく調査レポートの作成を目指す。評価結果は有望だが、計画を増やせば常に品質が上がるわけではないことも示された。

続きを読む
CCTest · Blog
HybridCUA、GUIとCLIを使い分けるコンピュータ操作エージェントを学習
AIエージェント
cctest.ai
AIエージェント

HybridCUA、GUIとCLIを使い分けるコンピュータ操作エージェントを学習

HybridCUAは、グラフィカルインターフェースとコマンドラインを組み合わせ、タスクに応じて両者を使い分けるコンピュータ操作エージェントの学習手法を提案する。9BモデルはOSWorldで53.6%の精度を達成し、ベースモデルを14.8ポイント上回った。

続きを読む
CCTest · Blog
Marathoner:AIエージェントの超長期実行能力を鍛える
AIエージェント
cctest.ai
AIエージェント

Marathoner:AIエージェントの超長期実行能力を鍛える

Marathonerは、複雑な目標に対してAIエージェントが長時間にわたり作業を続ける能力を高めるためのポストトレーニング手法です。タスク合成、拒否サンプリングによる微調整、サンドボックス上の強化学習、実行後半への追加報酬を組み合わせています。

続きを読む