記事一覧へ戻る
AIエージェント

SPyCE:マルチモーダルエージェントの経験を進化するスキルへ変える

読了目安 3 分

導入

マルチモーダルエージェントは、単に画像を見て答える段階から、画像を操作し、証拠を確認し、ツールを呼び出しながら推論する段階へ進んでいる。こうしたタスクでは、一度の認識能力だけでなく、複数ステップにわたる視覚操作やツール利用の型を学ぶことが重要になる。

論文「SPyCE: Skill-Policy Co-evolution for Multimodal Agents」は、この問題に対して、経験を単なる報酬や検索用メモリとして扱うのではなく、再利用可能なスキルとして蒸留するアプローチを提案している。著者らの主張は明確だ。強化学習は軌跡をスカラー報酬へ圧縮しがちで、方策は有用な手順を毎回探索し直す。一方、記憶ベースの方法は過去の経験を保存しても、主にテスト時の検索に依存し、方策自体に十分取り込まれない。

核心ポイント

  • 経験をスキルライブラリへ変換:SPyCEは、方策が生成した有用なロールアウトをもとにスキルを抽出し、訓練中にライブラリを更新する。
  • 階層的なスキル設計:実行スキルは局所的な視覚操作やツール利用を表し、ワークフロースキルは複数ステップの進め方を導く高レベルの事前知識を表す。
  • 方策とスキルの閉ループ:訓練時には、方策が検索されたスキルを条件としてロールアウトを行う。改善された方策はより良い軌跡を生み、それがさらにスキルライブラリを強化する。
  • 八つのベンチマークでの改善:論文では、SPyCEが強化学習ベースおよび記憶ベースのベースラインを一貫して上回ったと報告している。また、階層構造と共進化の仕組みはいずれも重要だと分析されている。

意義と影響

SPyCEの意義は、マルチモーダルエージェントの軌跡を、使い捨ての学習信号ではなく、将来の行動を導く構造化された知識として扱う点にある。画像の拡大、比較、証拠確認、ツール選択のような操作が繰り返し必要な場面では、こうしたスキル化が探索の無駄を減らす可能性がある。

より広く見れば、今後のエージェント訓練では、方策モデルだけでなく、方策とともに成長するスキルシステムが重要になるかもしれない。視覚推論、ツール利用、長いワークフローを組み合わせる応用において、スキルと方策の共同最適化は注目すべき方向性だ。

出典:arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
PILOT、長期タスク型エージェントに実行中の修正と進化を導入
AIエージェント
cctest.ai
AIエージェント

PILOT、長期タスク型エージェントに実行中の修正と進化を導入

PILOTは、エージェントの自己改善をタスク終了後の振り返りから、実行中の制御へ拡張する監督者・ワーカー型ハーネスを提案する。監督者は実行中のワーカーを方向転換または中止でき、得られた知見は再利用可能なスキルと記憶に変換される。

続きを読む
CCTest · Blog
WikiSkill:エージェントの経験を持続的知識へ変換し、スキルを進化させる
AIエージェント
cctest.ai
AIエージェント

WikiSkill:エージェントの経験を持続的知識へ変換し、スキルを進化させる

WikiSkillは、エージェントの実行経験、永続的なWiki型知識ベース、実行可能なスキルを分離しながら、相互に進化させる枠組みを提案する。複数のモデルで性能を高め、モデルをまたぐスキル移転の可能性も示した。

続きを読む