ASCENT、長期タスク型エージェントの配備中学習を実現
背景
長期タスクを実行するAIエージェントは、複数回の推論、ツール呼び出し、環境への操作を積み重ね、最後に成功または失敗の検証信号を受け取る。実際の配備環境では、関連するタスクが連続して到着することが多い。そのため、先行タスクで得られた実行軌跡を、後続タスクの改善に利用できる可能性がある。
しかし、1回の試行をそのまま学習データにするのは危険だ。既存の文脈適応型エージェントは、反省、記憶、スキルなどをテキストとして保存することが多いが、その効果は適切な経験を検索できるか、また凍結された方策がその内容を正しく実行できるかに左右される。さらに、単一軌跡の生成トークンを直接模倣したり、結果だけを根拠に強化したりすると、無効な操作や偶然の振る舞いまで固定し、方策を不安定にする恐れがある。
ASCENTの仕組み
ASCENTは、Agentic Self-distillation for Cross-task EvolutioN at Test-timeの略称で、検証済み経験を事後的な自己蒸留の目標に変換する。流れは次の通りだ。
- 一度だけ実行する:タスクストリームの各タスクを1回処理し、その軌跡と終了時の検証結果だけを永続更新の信号として使う。
- 事後情報を与える:モデルの初期状態を保った凍結コピーに、検証済みの完全な軌跡を読ませる。実行中の方策には見えていなかった結果を踏まえ、各位置での次トークン分布を予測させる。
- LoRAへ蒸留する:その分布を永続的なLoRAパラメータに蒸留し、後続タスクで利用できる更新済み方策を作る。
さらに、無効なアクションに対応するターンを除外することで、より有効な経験に絞った蒸留も行う。外部の正解や、より大きな教師モデルを導入するのではなく、同じモデルの安定した初期コピーに「結果を知った後の視点」を与える点が特徴である。
結果と意義
論文によれば、ASCENTはALFWorldとWebShopで、評価した両方のモデル規模において、ベースモデルより正確な成功率を22ポイント以上向上させた。また、エピソード当たりのターン数が減り、保留された未見シーンにも改善が移転した。これは、外部の教師や参照解がなくても、検証済みの自己経験をテスト時学習の信号にできることを示している。
この研究の意義は、経験を検索可能な文章として保存するだけでなく、実際に行動する方策へ反映させる点にある。一方で、終端の検証信号を前提とし、単一軌跡からの更新にはノイズや失敗の影響が残る。より疎で遅い、あるいは自由度の高いフィードバック環境でも安定して学習できるかが、今後の重要な課題となる。
コメント
ログイン状態を確認中…
コメントを読み込み中…