WEFT:ツール利用後学習を支えるシステム全体の拡張
導入
大規模言語モデルにツールを使わせる際、APIや実行可能な環境を増やすだけでは十分ではありません。実行可能なタスクかどうか、エージェントの実行ハーネスが適切か、評価器が本当に達成度を測れているかも、学習信号の質を左右します。環境だけを拡張すると、モデルの失敗ではない問題までモデルの能力不足として扱う可能性があります。
WEFT(Whole-system Evolution For Tool-use Post-training)は、この問題に対し、環境・タスク・エージェントハーネス・評価器を一つのエージェント対話システムとして扱います。目的は、ツール利用後学習を単純なデータ量の拡大から、システム全体の進化へと広げることです。
主な仕組み
- 実行可能な対話を広げる。 WEFTは8,172個の実行可能なMCP、64,755個のツール、41,695個の認証済み原子タスクを構築し、それらを11,884個のタスクに組み合わせます。タスクの長さの中央値は20原子タスクターンで、複数のMCPや分野にまたがるものも含まれます。
- 対話形式を多様化する。 同じタスクを、完全な依頼として自律実行させることも、シミュレートされたユーザーが段階的に提示することもできます。さらにReAct、OpenClaw、Hermesなどのハーネスを使って多様な軌跡を収集します。タスク集合を固定した比較では、AgenticとSimUserの混合によりWEFT-35B-A3Bが平均3.18ポイント向上し、追加のハーネスを使うと報告されたベンチマークでさらに平均9.71ポイント向上しました。
- 実行結果で構成要素を改善する。 失敗したロールアウトを直ちにモデルの方策の失敗とはみなしません。ツール呼び出し、チェックポイント、データベース、ワークスペースの変化を調べ、方策・環境・タスク・検証器のどこに問題があるかを切り分けます。3回の自己進化後、選択された教師軌跡のツール呼び出しエラー率は1.76%から0.96%に下がり、3つのベンチマークでは5.25、4.33、3.65ポイントの改善が報告されています。
- 長い学習を安定させる。 Prefix-preserving samplingは検証済みの進行を残し、軌跡全体を捨てずに失敗した原子タスクから再試行します。原子ターン単位のクレジット割り当ては、同じ履歴と状態から得た候補を比較し、現在のタスクに信号を集中させます。強化学習前には、言語モデルでタスクと実行可能な検証器の整合性を確認しますが、RLで使う報酬は実行可能な評価のままです。
- 状態を分離して復旧可能にする。 MegaMCPは再利用可能なツールサービスをサンドボックス外で提供しながら、各ロールアウトのデータベースとワークスペースを分離・復旧可能に保ちます。1,000タスクの実験では、サンドボックスへのアップロード量が773.5 MiBから34.8 MiBへ減少しました。
意義
WEFTが示すのは、ツール利用後学習が環境の数だけで決まらないという点です。タスクの実行可能性、対話の設計、ハーネスの挙動、評価器の正確さが一体となって、学習できるデータを形作ります。
特に、複数のツールや依存関係のある手順を扱う長時間ワークフローでは、成功した前半を保持できることや、状態をスナップショットから復元できることが重要です。実行トレースは学習データであるだけでなく、どの構成要素を改善すべきかを示す診断情報にもなります。一方、報告された結果は論文内のモデル、タスク、ベンチマークに基づくため、他のモデルや実運用環境への一般化は今後の検証課題です。
コメント
ログイン状態を確認中…
コメントを読み込み中…