記事一覧へ戻る
AIエージェント

LongHorizon-Harness:長期タスク型エージェントを状態管理から見直す

読了目安 3 分

導入

LLM エージェントが短い対話を超えて、実際の作業に近い長期タスクを扱うようになると、重要になるのは単発の回答能力だけではない。複数の手順をまたいで目標を保ち、ツールを使い、途中の結果を確認し、必要なら方針を修正する力が求められる。LongHorizon-Harness は、この長期実行で起きやすい問題に正面から取り組む。

従来のエージェント harness では、タスクの実行履歴、現在の状態、完了判定が同じコンテキストの中に積み上がりがちだった。コンテキストが長くなるほど、どの情報が実際に環境で確認された事実なのか、どれがモデルの自己判断なのかが曖昧になる。誤った自己評価が後続の判断に入り込むと、失敗が連鎖する可能性がある。

核心ポイント

  • タスク状態を外部化:LongHorizon-Harness は、実行コンテキストとは別に明示的なタスク状態を管理する。
  • 検証済み事実で更新:状態は、環境から独立に確認された事実によってのみ更新される。
  • Manage-Execute-Audit ループ:Manager が状態を保ち次のサブタスクを決め、Executor が新しいコンテキストで実行し、読み取り専用の Auditor が環境状態を検証する。
  • 誤りの伝播を抑制:Executor の自己申告がそのまま全体状態に反映されないため、誤った完了判断が後の行動を支配しにくい。
  • 柔軟な接続:軽量な AgentAdapter により、既存のモデルや harness のネイティブループを大きく変更せずに組み合わせられる。

報告された結果では、LongHorizon-Harness により Qwen 3.7-Plus は WeaveBench で 51.8% から 80.7%、Terminal-Bench 2.1 で 69.7% から 77.2%、OSWorld 2.0 で 2.8% から 8.3% に向上した。また Claude Opus 4.7 も、OSWorld 2.0 のサブセットで 20.0% から 34.3% に改善している。

意義と影響

この研究の意義は、単なるスコア改善にとどまらない。長期タスクのエージェントには、信頼できる作業記録と状態管理が必要だという点を明確に示している。コンテキストウィンドウを広げるだけでは、未検証の仮定や誤った進捗報告が混ざる問題は解決しない。

LongHorizon-Harness は、エージェントの外側に「作業台帳」と「監査層」を置く設計に近い。Executor は目の前のサブタスクに集中し、Manager は全体の進行を管理し、Auditor は環境が本当に期待どおり変化したかを確認する。この分業は、端末操作、Web 操作、デスクトップ環境のように失敗の連鎖が起こりやすい領域で特に意味を持つ。

もちろん、実運用ではコスト、遅延、監査の精度など追加の課題が残る。それでも、長期エージェントの信頼性を高めるには、モデル性能だけでなく、状態をどう保持し、どう検証し、どう誤りを止めるかが重要になることを示す研究だと言える。

Source: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SoL-Pi、長時間動くコーディングエージェントのトークン消費を削減
AIエージェント
cctest.ai
AIエージェント

SoL-Pi、長時間動くコーディングエージェントのトークン消費を削減

SoL-Piは、コーディングエージェントの基盤モデルではなく、その周囲で動くharnessを自動研究ループで改善する手法です。EdgeBenchではPiに近い性能を保ちながら、トークン通信量とAPIコストを大きく削減したと報告しています。

続きを読む
CCTest · Blog
EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる
AIエージェント
cctest.ai
AIエージェント

EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる

ポップアップや読み込み遅延、移動するウィジェットは、事前に固定したGUI操作計画を簡単に崩してしまう。EvoSkill-GUIは追加学習なしで、実行結果を技能の更新につなげる「反省・修正・再利用」ループを提案する。

続きを読む
CCTest · Blog
コード支援から推論基盤の最適化へ、GLMのInfra Agentはどこまで進んだのか
AIエージェント
cctest.ai
AIエージェント

コード支援から推論基盤の最適化へ、GLMのInfra Agentはどこまで進んだのか

智譜は、GLM-5.3を基盤とするInfra Agentが、10万枚を超える国産チップで構成されたクラスタ上でGLM-5.3-Flashの適応、診断、性能改善に関与したと発表しました。チームによれば、エンドツーエンドのスループットは2週間足らずで初期ベースラインの約3倍に達しました。

続きを読む