記事一覧へ戻る
AIエージェント

LongCat-DeepResearchが示す、協調型マルチエージェント研究の設計

読了目安 3 分

導入

深い調査を行うAIに必要なのは、単に多くの情報を検索する能力だけではない。開かれた問いを実行可能な課題へ分解し、根拠を集め、異なる調査結果を一貫したレポートへまとめる必要がある。LongCatチームの技術報告で紹介されたLongCat-DeepResearchは、この問題を単一モデルの一括生成ではなく、役割を分けたワークフローとして扱う。

ワークフローの特徴

処理は主に次の段階で構成される。

  • 調査前の計画:複数の計画エージェントが外部情報を調べ、異なる観点から問いを整理する。その結果を実行可能な研究計画、ResearchSpecとしてまとめる。
  • セクションごとの並列調査:調査エージェントは計画に基づいて担当部分を受け持ち、それぞれのコンテキストで情報収集、分析、草稿作成を進める。
  • 統合後の全体レビュー:各セクションを組み合わせた後、レポート全体を確認し、論理のつながりや情報の抜け、根拠の使い方を点検する。
  • 局所的な修正:問題のあるセクションだけを修正し、レポート全体を何度も書き直す方式への依存を減らす。全体の整合性と編集コストの両立を狙った設計だ。

また、このワークフローはレポート作成だけでなく、LongCatの汎用モデルを中間学習・事後学習するための研究課題や軌跡の構築にも利用できる。つまり、システム自体がモデル改善のためのデータ生成基盤にもなりうる。

評価結果から見えること

LongCat-DeepResearchのスコアは、DeepResearchBenchで55.25、DeepResearchBench IIで51.35、ResearchRubricsで79.83だった。社内ベンチマークでは76.04を獲得し、比較対象4システム中2位となった。計画と分業を組み合わせることで、調査型タスクに対応する力が高まる可能性はあるが、これらの結果だけであらゆる用途で優位だとは言えない。

開発セットの分析では、複数の計画視点を組み合わせることに利点が見られた。一方、計画をさらに細かく改善することの効果は一貫していない。計画の回数や量を増やせばよいわけではない。追加編集は二つのベンチマークで平均的な自動可読性評価を改善したが、ベンチマークごとの傾向は異なった。読みやすさ、根拠の網羅性、分析の質には依然として調整が必要である。

意義と残された課題

この研究の意義は、深い調査を一度きりの生成から、分担・確認・修正が可能な工程へ置き換えた点にある。根拠が複数の場所に分散する広いテーマでは、セクション単位の協調が有効になりうる。ただし、エージェント間の調整コストや、セクション間で事実が食い違うリスクも生じる。提供された素材には、実行コスト、応答時間、比較対象の詳細、人手による事実確認の結果は含まれていない。実運用での優位性を判断するには、これらの情報と独立した再現検証が必要になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Raven:進化するエージェント・ハーネスを組み合わせる仕組み
AIエージェント
cctest.ai
AIエージェント

Raven:進化するエージェント・ハーネスを組み合わせる仕組み

Ravenは、モデルや領域ごとの専用ハーネスを自動で構築・改善し、それらを組み合わせる「ハーネスのハーネス」を提案します。長期かつ領域横断的な作業を、単一エージェントの能力ではなく、複数の能力単位の協調として捉え直す試みです。

続きを読む
CCTest · Blog
HybridCUA、GUIとCLIを使い分けるコンピュータ操作エージェントを学習
AIエージェント
cctest.ai
AIエージェント

HybridCUA、GUIとCLIを使い分けるコンピュータ操作エージェントを学習

HybridCUAは、グラフィカルインターフェースとコマンドラインを組み合わせ、タスクに応じて両者を使い分けるコンピュータ操作エージェントの学習手法を提案する。9BモデルはOSWorldで53.6%の精度を達成し、ベースモデルを14.8ポイント上回った。

続きを読む
CCTest · Blog
Marathoner:AIエージェントの超長期実行能力を鍛える
AIエージェント
cctest.ai
AIエージェント

Marathoner:AIエージェントの超長期実行能力を鍛える

Marathonerは、複雑な目標に対してAIエージェントが長時間にわたり作業を続ける能力を高めるためのポストトレーニング手法です。タスク合成、拒否サンプリングによる微調整、サンドボックス上の強化学習、実行後半への追加報酬を組み合わせています。

続きを読む