記事一覧へ戻る
AIエージェント

StateAct:ピクセルより先にプログラム状態を見るコンピュータ操作エージェント

読了目安 3 分

導入

コンピュータ操作エージェントの改良は、これまで「画面をより正確に読む」方向に進みがちだった。ボタンを見つけ、クリック位置を決め、スクリーンショットから次の行動を推測するという発想である。StateAct はそこに別の視点を持ち込む。画面は、ファイル、アプリケーションのバックエンド、DOM、保存済み成果物といった本当のタスク状態を描画したものにすぎず、しかも情報は失われている、という考え方だ。

主要ポイント

  • 状態を主インターフェースにする:StateAct の主エージェントは、スクリーンショットではなくコードを通じてプログラム状態を扱う。ファイルの有無、保存先、DOM 構造、アプリ内部のデータなどを直接確認し、必要に応じて操作する。
  • GUI は専門サブエージェントに限定:GUI 操作は不要になるわけではない。視覚判断やクリックが本当に必要なサブゴールだけ、専用の GUI サブエージェントが担当する。素材によれば、108 タスク中 GUI サブエージェントが必要だったのは 28 タスクで、主エージェントのステップに占める GUI 関連処理は 1.1% にとどまった。
  • 検証も状態ベースで行う:独立した finish gate が、出力が存在しない、保存されていない、誤ったパスに書かれているといった構造的失敗を終了前に確認する。こうした問題は画面だけでは見落としやすいが、状態にアクセスできれば直接検査しやすい。
  • 性能とコストの改善:OSWorld 2.0 では、Claude Opus 4.8 の二値成功率が 20.6% から 26.9% に、部分成功率が 54.8% から 61.6% に向上した。同じモデルをスクリーンショット中心で動かす場合と比べ、タスクあたりのコストは約 9 分の 1 とされる。一方、GUI サブエージェントを使わない code-only 版の部分成功率は 45.9% で、スクリーンショット基準の 54.8% を下回った。つまり、視覚を捨てるのではなく、使う場所を絞る設計である。

意義

StateAct が示すのは、コンピュータ操作が単なる視覚認識問題ではないという点だ。長いタスクでは、目標を保ち、中間状態を管理し、結果が正しく保存されたかを確認する能力が重要になる。行動、記憶、検証をプログラム状態に接地することで、ピクセル由来の曖昧さとトークン消費を減らし、推論と計画の比重を高められる。

素材では、Claude Opus 4.8 だけでなく内部 31B SFR-CUA モデルでも複数ベンチマークの改善が報告されている。これは、StateAct が特定モデルの技巧ではなく、エージェント設計上の一般的な方向性である可能性を示している。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
T1:長期ターミナルタスクに挑む強化学習エージェント
AIエージェント
cctest.ai
AIエージェント

T1:長期ターミナルタスクに挑む強化学習エージェント

Tencent Hunyuanの研究チームは、クラウドサンドボックス内の実際のシェルを操作する1220億パラメータのMoEモデル、T1を発表しました。検証器による報酬と、学習時・推論時のずれを抑える軌跡再現技術を組み合わせています。

続きを読む
CCTest · Blog
Gander:連続マルチモーダル対話とエージェント推論を統合する構成
AIエージェント
cctest.ai
AIエージェント

Gander:連続マルチモーダル対話とエージェント推論を統合する構成

Ganderは、動画・音声・テキストを継続的に処理し、従来のターン制対話を超えようとするエンドツーエンドモデルです。「小脳と脳」の協調により、低遅延の会話と複雑なエージェント処理を両立させます。

続きを読む
CCTest · Blog
NeoHorse-1、エージェントのルーティングで再帰的自己改善を探る
AIエージェント
cctest.ai
AIエージェント

NeoHorse-1、エージェントのルーティングで再帰的自己改善を探る

NeoHorse-1は、モデルのルーティング、ツール利用、評価結果を次の学習データに反映するエージェント向け事後学習の試みです。単純なモデル大型化ではなく、評価・選択・更新の循環を構築します。

続きを読む