記事一覧へ戻る
AIエージェント

HybridCUA、GUIとCLIを使い分けるコンピュータ操作エージェントを学習

読了目安 3 分

背景

コンピュータ操作エージェントは、画面上でクリックや入力を行い、実際のソフトウェア環境でタスクを完了する能力を高めている。一方で、現在の多くのシステムはグラフィカルユーザーインターフェース(GUI)に大きく依存している。GUIはアプリケーションを問わず利用しやすい反面、画面上の要素を探して何度もクリックする必要があり、処理が遅くなったり、レイアウトの変化による誤操作が起きたりする。

これに対して、アプリケーション固有のAPIやツールを追加すれば効率を高められる可能性がある。しかし、その方法ではアプリごとに大きな開発コストが発生し、対応範囲を広げることも難しい。HybridCUAは、GUIの汎用性とコマンドラインインターフェース(CLI)の効率性を組み合わせる方向を示している。

重要なのはCLIへのアクセスではなく使い分け

単にエージェントへ端末を与えるだけでは十分ではない。どの場面でCLIを使うべきか、どのコマンドを選ぶか、そしてコマンドの結果を次のGUI操作にどうつなげるかを学習する必要があるからだ。視覚的な状態確認や画面上の要素の操作にはGUIが向き、ファイル処理や繰り返し作業などにはCLIが向く場合がある。

研究チームは、GUIのみ、CLIのみ、そしてGUIとCLIを交互に利用する軌跡の3種類を作成した。このデータ構築パイプラインから、5K件のハイブリッド軌跡と3K件の検証済みRLVRタスクを含むHybridCUA-8Kを作成した。これにより、モデルは利用可能なツールだけでなく、複数の実行経路とツール切り替えのパターンも学習できる。

学習は2段階で進める。まず、構築した軌跡を使って教師あり微調整を行う。その後、CLIの利用状況を考慮する報酬を用いたオンライン強化学習を行い、必要な場面でだけCLIを使い、安定して結果を得る行動を促す。重要なのはCLIの利用回数を増やすことではなく、タスクに応じて選択的に使うことだ。

結果と意味

HybridCUA-9BはOSWorldで53.6%の精度を記録し、ベースモデルから14.8ポイント向上した。また、WindowsAgentArenaでも4.0ポイントの改善が報告されている。これらの結果は、GUIとCLIを協調させる学習がコンピュータ操作エージェントの性能を高め、複数プラットフォームへの展開にも可能性を持つことを示している。

この研究から得られる示唆は、ツール選択そのものをエージェントの中核能力として扱う必要があるという点だ。視覚的な操作が必要な場面と、短いコマンドで効率化できる場面を区別できれば、より柔軟な自動化が期待できる。

ただし、提示された素材には詳細なタスク別結果、失敗例、CLI戦略ごとのアブレーションは含まれていない。そのため、報告された改善は手法全体の有効性を示すものとして捉えつつ、より多様なアプリケーションや環境での頑健性は今後の検証課題となる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Raven:進化するエージェント・ハーネスを組み合わせる仕組み
AIエージェント
cctest.ai
AIエージェント

Raven:進化するエージェント・ハーネスを組み合わせる仕組み

Ravenは、モデルや領域ごとの専用ハーネスを自動で構築・改善し、それらを組み合わせる「ハーネスのハーネス」を提案します。長期かつ領域横断的な作業を、単一エージェントの能力ではなく、複数の能力単位の協調として捉え直す試みです。

続きを読む
CCTest · Blog
LongCat-DeepResearchが示す、協調型マルチエージェント研究の設計
AIエージェント
cctest.ai
AIエージェント

LongCat-DeepResearchが示す、協調型マルチエージェント研究の設計

LongCat-DeepResearchは、強化されたLongCatモデルとマルチエージェント型ワークフローを組み合わせ、根拠に基づく調査レポートの作成を目指す。評価結果は有望だが、計画を増やせば常に品質が上がるわけではないことも示された。

続きを読む
CCTest · Blog
Marathoner:AIエージェントの超長期実行能力を鍛える
AIエージェント
cctest.ai
AIエージェント

Marathoner:AIエージェントの超長期実行能力を鍛える

Marathonerは、複雑な目標に対してAIエージェントが長時間にわたり作業を続ける能力を高めるためのポストトレーニング手法です。タスク合成、拒否サンプリングによる微調整、サンドボックス上の強化学習、実行後半への追加報酬を組み合わせています。

続きを読む