記事一覧へ戻る
AIエージェント

WEFT:ツール利用後学習を支えるシステム全体の拡張

読了目安 4 分

導入

大規模言語モデルにツールを使わせる際、APIや実行可能な環境を増やすだけでは十分ではありません。実行可能なタスクかどうか、エージェントの実行ハーネスが適切か、評価器が本当に達成度を測れているかも、学習信号の質を左右します。環境だけを拡張すると、モデルの失敗ではない問題までモデルの能力不足として扱う可能性があります。

WEFT(Whole-system Evolution For Tool-use Post-training)は、この問題に対し、環境・タスク・エージェントハーネス・評価器を一つのエージェント対話システムとして扱います。目的は、ツール利用後学習を単純なデータ量の拡大から、システム全体の進化へと広げることです。

主な仕組み

  • 実行可能な対話を広げる。 WEFTは8,172個の実行可能なMCP、64,755個のツール、41,695個の認証済み原子タスクを構築し、それらを11,884個のタスクに組み合わせます。タスクの長さの中央値は20原子タスクターンで、複数のMCPや分野にまたがるものも含まれます。
  • 対話形式を多様化する。 同じタスクを、完全な依頼として自律実行させることも、シミュレートされたユーザーが段階的に提示することもできます。さらにReAct、OpenClaw、Hermesなどのハーネスを使って多様な軌跡を収集します。タスク集合を固定した比較では、AgenticとSimUserの混合によりWEFT-35B-A3Bが平均3.18ポイント向上し、追加のハーネスを使うと報告されたベンチマークでさらに平均9.71ポイント向上しました。
  • 実行結果で構成要素を改善する。 失敗したロールアウトを直ちにモデルの方策の失敗とはみなしません。ツール呼び出し、チェックポイント、データベース、ワークスペースの変化を調べ、方策・環境・タスク・検証器のどこに問題があるかを切り分けます。3回の自己進化後、選択された教師軌跡のツール呼び出しエラー率は1.76%から0.96%に下がり、3つのベンチマークでは5.25、4.33、3.65ポイントの改善が報告されています。
  • 長い学習を安定させる。 Prefix-preserving samplingは検証済みの進行を残し、軌跡全体を捨てずに失敗した原子タスクから再試行します。原子ターン単位のクレジット割り当ては、同じ履歴と状態から得た候補を比較し、現在のタスクに信号を集中させます。強化学習前には、言語モデルでタスクと実行可能な検証器の整合性を確認しますが、RLで使う報酬は実行可能な評価のままです。
  • 状態を分離して復旧可能にする。 MegaMCPは再利用可能なツールサービスをサンドボックス外で提供しながら、各ロールアウトのデータベースとワークスペースを分離・復旧可能に保ちます。1,000タスクの実験では、サンドボックスへのアップロード量が773.5 MiBから34.8 MiBへ減少しました。

意義

WEFTが示すのは、ツール利用後学習が環境の数だけで決まらないという点です。タスクの実行可能性、対話の設計、ハーネスの挙動、評価器の正確さが一体となって、学習できるデータを形作ります。

特に、複数のツールや依存関係のある手順を扱う長時間ワークフローでは、成功した前半を保持できることや、状態をスナップショットから復元できることが重要です。実行トレースは学習データであるだけでなく、どの構成要素を改善すべきかを示す診断情報にもなります。一方、報告された結果は論文内のモデル、タスク、ベンチマークに基づくため、他のモデルや実運用環境への一般化は今後の検証課題です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
CacheBack、受信側が必要とするKVキャッシュだけを多エージェント間で転送
AIエージェント
cctest.ai
AIエージェント

CacheBack、受信側が必要とするKVキャッシュだけを多エージェント間で転送

CacheBackは、受信エージェントの情報要求に合わせて送信側のKVキャッシュを選別する、受信側条件付きの潜在通信手法です。FanOutQAでは、転送状態を削減しながら精度と処理遅延の改善が報告されています。

続きを読む
CCTest · Blog
VeriHarness、長期タスク向けにLLMエージェントを検証者へ
AIエージェント
cctest.ai
AIエージェント

VeriHarness、長期タスク向けにLLMエージェントを検証者へ

VeriHarnessは、テスト時に正解例や採点基準がなくても、長期タスクを処理するエージェントの成果物を検証・改善するためのフレームワークです。複数ロールアウトの不一致と一致を調べ、環境内の証拠を使って最終成果物を修正します。

続きを読む
CCTest · Blog
LLMエージェントはなぜ特定の情報源を選ぶのか
AIエージェント
cctest.ai
AIエージェント

LLMエージェントはなぜ特定の情報源を選ぶのか

買い物、ホテル、学術検索を対象にした研究で、LLMエージェントが候補の適合度だけでなく、商品や情報の出所にも系統的な好みを示すことが分かりました。出所を隠す、情報を補う、出所に基づく推測を抑える指示を加えることで、その影響は弱められます。

続きを読む