記事一覧へ戻る
AIエージェント

Prime Agent:長期稼働するAIエージェントのための永続ランタイム

読了目安 3 分

導入

長期にわたって動作するAIエージェントは、モデルの推論力だけでなく、周囲の実行基盤にも大きく左右されます。コンテキストが増えすぎる、途中の計算結果が失われる、ツール実行後の状態が不明になる、失敗から復旧できないといった問題が起きると、観測された失敗がモデル由来なのか、ハーネス由来なのか分かりにくくなります。Prime Agentは、この周辺基盤を永続的で観察可能なものにするためのオープンソース・ハーネスです。

主な仕組み

  • 永続するIPython REPL:Recursive Language Model(RLM)の抽象化に基づき、モデルがコンテキストをプログラムで処理し、テスト時に追加計算を利用できます。REPLが継続するため、変数、出力、中間成果物を各ターンの後に作り直す必要がありません。
  • 軌跡をまたぐ継続状態:Continual Harnessは、履歴、メモリ、スキル、プロンプト、サブエージェントの仕様を保存します。エージェントは毎回ゼロから始めるのではなく、過去の実行から再利用可能な情報を引き継げます。
  • サブエージェント間の直接通信:再帰的なサブエージェントが直接連絡を取り、探索、実装、検証などの役割を分担できます。複雑な作業を並列化し、結果を統合・改良するための構成です。
  • 実行、復旧、検証の共通化:Prime Agentは実行、エラー復旧、結果検証、リソース計測を標準化します。Agents Viewでは、デーモンが管理するセッションを人間が確認・操作できます。

評価結果と読み方

論文によると、Prime AgentはARC-AGI-3 RHAEのBest@1を30%から95.5%へ引き上げました。また、長文脈コーディング、GPUカーネル生成、エミュレーター構築、自律nanoGPTスピードランでも、ネイティブ構成や一般的なハーネスと同等以上の結果を示したとされています。Factorioでは、反復的な改良が技術の継続的な進展を支え、専用サブエージェントが並列作業に役立ったと報告されています。

ここから得られる重要な示唆は、エージェント評価がランタイムの評価でもあるという点です。状態を保存し、計算を追加し、失敗から復旧し、成果を検証できる環境は、単純な対話ループでは表に出ない能力を引き出す可能性があります。一方、要約だけでは各実験の詳細な設定、コスト、アブレーションは確認できません。数値は完全なエージェント・ハーネス構成の結果として捉え、基盤モデル単体の向上と同一視しないことが重要です。

意義

Prime Agentは、エージェントに特定の戦略を押し付けるのではなく、モデル自身が作業手順を組み立て、改良できる環境を提供します。研究者にとっては、スクリプトの不安定さではなく、堅牢な実行環境におけるモデルの実用的な上限を測る助けになります。開発者にとっても、永続セッション、記憶、検証、リソース管理は、長時間動作するコーディングエージェントを構築する際の再利用可能な部品です。

今後のエージェント開発では、モデルの規模だけでなく、ランタイム、メモリ方針、協調プロトコル、復旧能力の設計も競争力になりそうです。Prime Agentはその検証に使える公開実装ですが、異なるモデルやコスト条件での一般性は、追加の再現実験を待つ必要があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Apodex 1.1、推論モデルから継続的に仕事を完遂するエージェントへ
AIエージェント
cctest.ai
AIエージェント

Apodex 1.1、推論モデルから継続的に仕事を完遂するエージェントへ

Apodex 1.1は、回答を生成するだけでなく、ファイル操作や検索、コード実行を伴う長期タスクの完遂を目指す。環境の拡張と非同期のマルチエージェント協調を組み合わせ、35BパラメータのMini版も提供する。

続きを読む
CCTest · Blog
個体知能からシステム知能へ:LLMエージェントに必要なGraph Engineering
AIエージェント
cctest.ai
AIエージェント

個体知能からシステム知能へ:LLMエージェントに必要なGraph Engineering

異なる専門性、並列処理、相互検証、永続的な状態管理が必要なタスクでは、単一のLLMエージェントを強化するだけでは不十分です。Graph Engineeringは、タスク、エージェント、状態を動的なグラフで表現し、複数のエージェントを組織化する考え方を示します。

続きを読む
CCTest · Blog
AgentMercury、検証可能な業務環境を大規模に合成
AIエージェント
cctest.ai
AIエージェント

AgentMercury、検証可能な業務環境を大規模に合成

AgentMercuryは、特定のタスクやベンチマーク向けの模擬環境ではなく、持続的に変化する業務世界を生成するフレームワークです。研究では14業種・50カ国にまたがる4,783個の実行可能な環境を構築し、企業業務と一部の領域外評価で改善を報告しています。

続きを読む