記事一覧へ戻る
AIエージェント

RHI:AIエージェントの「ハーネス」を自己改善する試み

読了目安 3 分

導入

AIエージェントは、単にモデルを一度呼び出すだけでは動かないことが多い。ツール利用、役割分担、文脈の保持、複数ステップの実行ループなどをまとめる外側の仕組みが必要になる。論文「Recursive Harness Self-Improvement」は、この実行時の足場である harness を、手作業で固定する部品ではなく、継続的に改善できる対象として捉える。

主要ポイント

  • 改善対象はモデルだけではない。 研究では harness を、エージェントループを記述するプロンプトレベルの仕様として表す。どの情報を保持し、どのタイミングで共有し、どのように次の行動へつなげるかが最適化の対象になる。
  • RHI は履歴を使って自分自身を改訂する。 供給者側の大規模な scaffold を頻繁に作り直すのではなく、ユーザーが構築したタスク固有の harness を少数回だけ更新する。各反復では、過去の版同士を比較するフィードバックを使って新しい版を作る。
  • 評価は合成的な ML 研究タスクで実施。 対象は量的金融、ロボティクス、薬学にまたがる30件の合成タスクである。分析、計画、実験結果の統合が必要なため、ワークフロー設計の差が出やすい。
  • 低い推論強度でも性能上限が上がる。 論文によれば、少数の RHI 反復により、low reasoning effort のエージェントの性能上限が大きく向上し、対応する maximum reasoning effort 設定を上回った。さらに推論コストは最大60%削減されたという。
  • 鍵は長い推論ではなく情報流。 著者らは、改善の主因をより長い推論トレースではなく、タスク固有の文脈管理とエージェント間の情報受け渡しの改善にあると説明している。

意味と影響

この研究の実務的な示唆は明確だ。エージェントを強くする方法は、より大きなモデルを選ぶことや推論予算を増やすことだけではない。文脈の要約、引き継ぎ、再利用の設計を改善するだけでも、性能とコストのバランスを変えられる可能性がある。

さらに重要なのは、model–harness co-evolution という見方である。harness は現在の実行結果を左右するだけでなく、その実行トレースを通じて将来の学習データの質にも影響し得る。今後のエージェント開発では、モデル、ツール、記憶、オーケストレーションを一体として設計する力がより重要になるだろう。

ただし、実験は合成タスクに基づくため、実運用の複雑な環境へそのまま一般化するには注意が必要だ。それでも RHI は、モデルの自己改善だけでなく「モデルの使い方」の自己改善が重要になる方向性を示している。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
UI-Venus-2:ベンチマークを超えるマルチモーダルGUIエージェント
AIエージェント
cctest.ai
AIエージェント

UI-Venus-2:ベンチマークを超えるマルチモーダルGUIエージェント

UI-Venus-2は、実用的なGUI自動化を妨げる環境の狭さ、脆弱なタスク設計、結果検証の不確実性に取り組む基盤システムです。モバイル、ウェブ、デスクトップを統一的な推論・行動ループで扱い、重要な操作には安全機構を組み込みます。

続きを読む
CCTest · Blog
CAST、行動批評の学習で長期ツール利用エージェントの信頼性を高める
AIエージェント
cctest.ai
AIエージェント

CAST、行動批評の学習で長期ツール利用エージェントの信頼性を高める

CASTは、タスクの成否という疎な結果を、個々の行動を検証するための批評情報へ変換する。長期的で状態を持つツール利用タスクにおいて、実行前のリスク確認を学習させることを狙う。

続きを読む