記事一覧へ戻る
AIエージェント

RRSI、AIエージェントの再帰的自己改善に正則化を導入

読了目安 3 分

導入

大規模言語モデルを使ったエージェントの能力は、基盤モデルだけで決まるわけではない。プロンプトの構成、タスクの分解方法、ツールを呼び出す流れ、履歴を保存するメモリ、コンテキストの整理方法も、結果を大きく左右する。こうしたモデル周辺の構成要素は、一般にエージェント・ハーネスと呼ばれる。近年は、このハーネスを自動的に変更・評価する研究が進み、システムレベルの再帰的自己改善が試みられている。

しかし、進化を繰り返す仕組みには過適合の危険がある。評価に使ったタスクの形式や、特定ベンチマークで有効なツール利用パターンを覚えるだけでも、対象分割のスコアは上がり得る。タスクの分布が変われば、その改善が小さくなったり消えたりする可能性がある。

RRSIの仕組み

RRSIは「Regularized Recursive Self-Improvement of Agent Harnesses」の略で、ハーネスの進化に正則化の考え方を組み込む。凍結された基盤モデルの重みを直接更新するのではなく、候補の作り方と選び方を制約し、特定ベンチマーク向けの小手先ではなく、再利用しやすい仕組みを残すことを目指す。

  • 時間に応じた編集予算:提案器は、1つの候補にまとめられる編集数を制限する。予算を時間とともに変化させることで、大規模で原因を追いにくい変更を抑える。
  • 履歴を利用した探索:過去の進化履歴を参照し、まだ試していない経路を促す。同じ種類の変更を繰り返すことを避ける狙いだ。
  • 批評器による選別:セレクターに組み込まれた critic が、評価ベンチマークだけに合わせた提案をチェックする。
  • 剪定器による整理:pruner は、効果が小さすぎる変更、維持コストが高い変更、後続の変更で不要になった変更を削除する。

重要なのは、変更量を増やすことではなく、変更の価値と移植可能性を高める点にある。RRSIはスコアだけを追う進化ループに、探索の多様性、運用コスト、複数タスクでの再利用という観点を加えている。

結果と意味

提供された概要によれば、RRSIはコーディング、エージェント型ワークスペース、エンジニアリング設計を含む8つのベンチマークで評価された。進化に使った分割では最大14.1ポイント、5つの分布外ベンチマークでは最大4.7ポイントの改善が報告されている。両者の差は重要だ。前者は対象タスクからフィードバックを得て改善する能力を示し、後者は改善の一部が未知のタスクにも移る可能性を示唆する。

この研究が示すのは、再帰的自己改善の対象はモデルのパラメータに限らないということだ。モデルの周辺にあるワークフローを発見し、検証し、不要なものを捨てる仕組みも、エージェント開発の重要な競争領域になるだろう。

ただし、今回の素材は主に概要に限られており、詳しい実験条件、ベースライン、アブレーション結果は確認できない。批評器、剪定器、編集予算がそれぞれどの程度寄与したかは、論文本文での検証が必要だ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
VHD-Play、解いたメカニズムから検証可能なエージェントRL環境を生成
AIエージェント
cctest.ai
AIエージェント

VHD-Play、解いたメカニズムから検証可能なエージェントRL環境を生成

VHD-Playは、環境を先に作って評価規則を後付けするのではなく、解を求めた数学的メカニズムからエージェント向け環境を生成する手法です。状態変化、隠れたパラメータ、遅延する結果を含む長期的な相互作用を学習できます。

続きを読む
CCTest · Blog
Meta、AIエージェント「Muse」専用端末Muse Charmを披露
AIエージェント
cctest.ai
AIエージェント

Meta、AIエージェント「Muse」専用端末Muse Charmを披露

Metaは、スマートフォンを使わずにAIエージェント「Muse」を利用できる専用端末「Muse Charm」を開発している。12月のホリデーシーズンをめどに出荷する計画だが、仕様の多くはまだ明らかになっていない。

続きを読む
CCTest · Blog
Agensh、中央オーケストレーターなしで1,024エージェントを協調
AIエージェント
cctest.ai
AIエージェント

Agensh、中央オーケストレーターなしで1,024エージェントを協調

Agenshは中央のタスク管理役を置かず、複数のエージェントが自ら仕事を引き受け、知見を共有し、結果を検証・統合する仕組みを提案する。ProgramBenchでは、規模の拡大に伴ってテスト通過率が向上した。

続きを読む