記事一覧へ戻る
AIエージェント

DeepSearch-World:検証可能な環境で検索エージェントを自己蒸留する

読了目安 2 分

導入

ツールを使うエージェントの学習では、「自分の経験から本当に改善できるか」が大きな課題です。教師あり微調整は、あらかじめ整えられた教師軌跡に依存しがちで、強化学習は長い探索の途中で報酬が薄くなりやすいという弱点があります。DeepSearch-World は、この問題に対して、正しさを検証できる Web 環境を用意し、エージェントが自分の行動履歴から学習できるようにした点が特徴です。

主なポイント

  • 決定論的で検証可能な環境:検索結果とページ閲覧の流れを再現できるため、途中経過の良し悪しを追いやすい。
  • データ規模:実験環境には 420K 件の多段 QA タスクが含まれ、実体レベルのランダムウォークから構築されています。
  • 自己進化を支える能力:進捗の確認、根拠に基づく反省、失敗からの復帰といった行動を学びやすい設計です。
  • DeepSearch-Evolve の学習手順:軌跡を生成し、選別し、データを混ぜ、再度微調整する流れを反復します。
  • ベンチマーク結果:より高性能なモデルからの蒸留なしで、DeepSearch-World-9B は BrowseComp 31.2%、GAIA 61.5%、HotpotQA 93.4% を達成しました。

意義と影響

この研究の価値は、エージェント学習を「答え合わせができる世界」に近づけたことです。長い Web タスクでは、最終回答だけでなく、途中で迷ったことに気づけるか、無駄な探索から戻れるか、証拠に基づいて進路を修正できるかが重要です。検証可能な環境があれば、こうした中間行動も学習対象にできます。

また、教師あり学習と強化学習の間をつなぐアプローチとしても興味深いです。固定軌跡に縛られず、かといって曖昧な報酬だけに頼らないため、自己改善型の検索エージェント研究にとって実用的な足場になります。環境、420K の訓練プール、検証セット、モデル、コードを公開する予定も、今後の研究を後押ししそうです。

Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
実行環境なしで API エージェントを学習させる新手法
AIエージェント
cctest.ai
AIエージェント

実行環境なしで API エージェントを学習させる新手法

API を呼び出すエージェントの学習には、大量の高品質な軌跡が必要です。しかし本物の環境を整備するのは重い作業です。本論文は、API 仕様だけを使って LLM に状態付き環境を模擬させる方法を提案します。

続きを読む
CCTest · Blog
交渉AIは数値ではなく「振る舞い」から秘密を漏らす
AIエージェント
cctest.ai
AIエージェント

交渉AIは数値ではなく「振る舞い」から秘密を漏らす

新しい論文は、交渉中の値を暗号化しても、譲歩の速度や提示額の軌跡、収束パターンから私的制約が推測され得ると指摘する。著者らは、性能を保ちながら推論攻撃を弱める適応的なランダム化方策を提案している。

続きを読む