RRSI、AIエージェントの再帰的自己改善に正則化を導入
導入
大規模言語モデルを使ったエージェントの能力は、基盤モデルだけで決まるわけではない。プロンプトの構成、タスクの分解方法、ツールを呼び出す流れ、履歴を保存するメモリ、コンテキストの整理方法も、結果を大きく左右する。こうしたモデル周辺の構成要素は、一般にエージェント・ハーネスと呼ばれる。近年は、このハーネスを自動的に変更・評価する研究が進み、システムレベルの再帰的自己改善が試みられている。
しかし、進化を繰り返す仕組みには過適合の危険がある。評価に使ったタスクの形式や、特定ベンチマークで有効なツール利用パターンを覚えるだけでも、対象分割のスコアは上がり得る。タスクの分布が変われば、その改善が小さくなったり消えたりする可能性がある。
RRSIの仕組み
RRSIは「Regularized Recursive Self-Improvement of Agent Harnesses」の略で、ハーネスの進化に正則化の考え方を組み込む。凍結された基盤モデルの重みを直接更新するのではなく、候補の作り方と選び方を制約し、特定ベンチマーク向けの小手先ではなく、再利用しやすい仕組みを残すことを目指す。
- 時間に応じた編集予算:提案器は、1つの候補にまとめられる編集数を制限する。予算を時間とともに変化させることで、大規模で原因を追いにくい変更を抑える。
- 履歴を利用した探索:過去の進化履歴を参照し、まだ試していない経路を促す。同じ種類の変更を繰り返すことを避ける狙いだ。
- 批評器による選別:セレクターに組み込まれた critic が、評価ベンチマークだけに合わせた提案をチェックする。
- 剪定器による整理:pruner は、効果が小さすぎる変更、維持コストが高い変更、後続の変更で不要になった変更を削除する。
重要なのは、変更量を増やすことではなく、変更の価値と移植可能性を高める点にある。RRSIはスコアだけを追う進化ループに、探索の多様性、運用コスト、複数タスクでの再利用という観点を加えている。
結果と意味
提供された概要によれば、RRSIはコーディング、エージェント型ワークスペース、エンジニアリング設計を含む8つのベンチマークで評価された。進化に使った分割では最大14.1ポイント、5つの分布外ベンチマークでは最大4.7ポイントの改善が報告されている。両者の差は重要だ。前者は対象タスクからフィードバックを得て改善する能力を示し、後者は改善の一部が未知のタスクにも移る可能性を示唆する。
この研究が示すのは、再帰的自己改善の対象はモデルのパラメータに限らないということだ。モデルの周辺にあるワークフローを発見し、検証し、不要なものを捨てる仕組みも、エージェント開発の重要な競争領域になるだろう。
ただし、今回の素材は主に概要に限られており、詳しい実験条件、ベースライン、アブレーション結果は確認できない。批評器、剪定器、編集予算がそれぞれどの程度寄与したかは、論文本文での検証が必要だ。
コメント
ログイン状態を確認中…
コメントを読み込み中…