記事一覧へ戻る
AIエージェント

ASCENT、長期タスク型エージェントの配備中学習を実現

読了目安 3 分

背景

長期タスクを実行するAIエージェントは、複数回の推論、ツール呼び出し、環境への操作を積み重ね、最後に成功または失敗の検証信号を受け取る。実際の配備環境では、関連するタスクが連続して到着することが多い。そのため、先行タスクで得られた実行軌跡を、後続タスクの改善に利用できる可能性がある。

しかし、1回の試行をそのまま学習データにするのは危険だ。既存の文脈適応型エージェントは、反省、記憶、スキルなどをテキストとして保存することが多いが、その効果は適切な経験を検索できるか、また凍結された方策がその内容を正しく実行できるかに左右される。さらに、単一軌跡の生成トークンを直接模倣したり、結果だけを根拠に強化したりすると、無効な操作や偶然の振る舞いまで固定し、方策を不安定にする恐れがある。

ASCENTの仕組み

ASCENTは、Agentic Self-distillation for Cross-task EvolutioN at Test-timeの略称で、検証済み経験を事後的な自己蒸留の目標に変換する。流れは次の通りだ。

  • 一度だけ実行する:タスクストリームの各タスクを1回処理し、その軌跡と終了時の検証結果だけを永続更新の信号として使う。
  • 事後情報を与える:モデルの初期状態を保った凍結コピーに、検証済みの完全な軌跡を読ませる。実行中の方策には見えていなかった結果を踏まえ、各位置での次トークン分布を予測させる。
  • LoRAへ蒸留する:その分布を永続的なLoRAパラメータに蒸留し、後続タスクで利用できる更新済み方策を作る。

さらに、無効なアクションに対応するターンを除外することで、より有効な経験に絞った蒸留も行う。外部の正解や、より大きな教師モデルを導入するのではなく、同じモデルの安定した初期コピーに「結果を知った後の視点」を与える点が特徴である。

結果と意義

論文によれば、ASCENTはALFWorldとWebShopで、評価した両方のモデル規模において、ベースモデルより正確な成功率を22ポイント以上向上させた。また、エピソード当たりのターン数が減り、保留された未見シーンにも改善が移転した。これは、外部の教師や参照解がなくても、検証済みの自己経験をテスト時学習の信号にできることを示している。

この研究の意義は、経験を検索可能な文章として保存するだけでなく、実際に行動する方策へ反映させる点にある。一方で、終端の検証信号を前提とし、単一軌跡からの更新にはノイズや失敗の影響が残る。より疎で遅い、あるいは自由度の高いフィードバック環境でも安定して学習できるかが、今後の重要な課題となる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ツール利用エージェントはなぜ失敗するのか:証拠から行動への断絶
AIエージェント
cctest.ai
AIエージェント

ツール利用エージェントはなぜ失敗するのか:証拠から行動への断絶

エージェントが正しい最終状態に到達しても、その行動が事前に確立された証拠に基づいていたとは限りません。SafeActBench は、失敗が実行前の調査や、依存関係を伴う複数ステップの処理で起きやすいことを示しました。

続きを読む
CCTest · Blog
プロアクティブエージェントに必要なのは正確さだけではない
AIエージェント
cctest.ai
AIエージェント

プロアクティブエージェントに必要なのは正確さだけではない

プロアクティブな LLM エージェントは、ユーザーが依頼する前に計算資源を使って支援を準備する。新たな研究は、タスク能力、時間配分、信頼を 3T 原則として整理し、長期的な影響を評価する Proactivity-Gym を提案した。

続きを読む
CCTest · Blog
VeriHarness、長期タスク向けにLLMエージェントを検証者へ
AIエージェント
cctest.ai
AIエージェント

VeriHarness、長期タスク向けにLLMエージェントを検証者へ

VeriHarnessは、テスト時に正解例や採点基準がなくても、長期タスクを処理するエージェントの成果物を検証・改善するためのフレームワークです。複数ロールアウトの不一致と一致を調べ、環境内の証拠を使って最終成果物を修正します。

続きを読む