LongCat-DeepResearchが示す、協調型マルチエージェント研究の設計
導入
深い調査を行うAIに必要なのは、単に多くの情報を検索する能力だけではない。開かれた問いを実行可能な課題へ分解し、根拠を集め、異なる調査結果を一貫したレポートへまとめる必要がある。LongCatチームの技術報告で紹介されたLongCat-DeepResearchは、この問題を単一モデルの一括生成ではなく、役割を分けたワークフローとして扱う。
ワークフローの特徴
処理は主に次の段階で構成される。
- 調査前の計画:複数の計画エージェントが外部情報を調べ、異なる観点から問いを整理する。その結果を実行可能な研究計画、ResearchSpecとしてまとめる。
- セクションごとの並列調査:調査エージェントは計画に基づいて担当部分を受け持ち、それぞれのコンテキストで情報収集、分析、草稿作成を進める。
- 統合後の全体レビュー:各セクションを組み合わせた後、レポート全体を確認し、論理のつながりや情報の抜け、根拠の使い方を点検する。
- 局所的な修正:問題のあるセクションだけを修正し、レポート全体を何度も書き直す方式への依存を減らす。全体の整合性と編集コストの両立を狙った設計だ。
また、このワークフローはレポート作成だけでなく、LongCatの汎用モデルを中間学習・事後学習するための研究課題や軌跡の構築にも利用できる。つまり、システム自体がモデル改善のためのデータ生成基盤にもなりうる。
評価結果から見えること
LongCat-DeepResearchのスコアは、DeepResearchBenchで55.25、DeepResearchBench IIで51.35、ResearchRubricsで79.83だった。社内ベンチマークでは76.04を獲得し、比較対象4システム中2位となった。計画と分業を組み合わせることで、調査型タスクに対応する力が高まる可能性はあるが、これらの結果だけであらゆる用途で優位だとは言えない。
開発セットの分析では、複数の計画視点を組み合わせることに利点が見られた。一方、計画をさらに細かく改善することの効果は一貫していない。計画の回数や量を増やせばよいわけではない。追加編集は二つのベンチマークで平均的な自動可読性評価を改善したが、ベンチマークごとの傾向は異なった。読みやすさ、根拠の網羅性、分析の質には依然として調整が必要である。
意義と残された課題
この研究の意義は、深い調査を一度きりの生成から、分担・確認・修正が可能な工程へ置き換えた点にある。根拠が複数の場所に分散する広いテーマでは、セクション単位の協調が有効になりうる。ただし、エージェント間の調整コストや、セクション間で事実が食い違うリスクも生じる。提供された素材には、実行コスト、応答時間、比較対象の詳細、人手による事実確認の結果は含まれていない。実運用での優位性を判断するには、これらの情報と独立した再現検証が必要になる。
コメント
ログイン状態を確認中…
コメントを読み込み中…