OSWorld-Pro、コンピュータ操作エージェントを「結果」から「過程」で評価
導入
コンピュータ操作エージェント(Computer-Use Agents、CUAs)は、キーボードやマウス、グラフィカルなユーザーインターフェースを操作し、複数の手順からなる作業を実行する。これまでの評価では、作成されたファイルや最終的な画面状態など、タスク終了時の成果物が正しいかどうかを機能検証器で判定する方法が中心だった。
しかし、最終状態だけでは、エージェントがどの段階で失敗したのか分からない。入力文字を間違えたのか、クリック位置を誤ったのか、そもそも現在の目標と関係のない操作をしたのかによって、必要な改善策は異なる。NVIDIAの研究チームが提案したOSWorld-Proは、この問題に対して手順ベースの評価を導入する。
主なポイント
- タスクをサブゴールに分解。 OSWorld-Proは300以上のタスクと2800以上のサブゴールで構成される。各タスクを依存関係のある複数の段階として扱うことで、最終結果だけでなく、途中の進捗も追跡できる。
- 大規模な人手アノテーションを利用。 データセットは6万7000件を超える人手アノテーションを基盤とする。さらに、人間の判断に整合するよう設計されたLLMジャッジを使い、個々のサブゴールが達成されたかを評価する。
- 失敗の種類を切り分ける。 研究では、現在のサブゴールと無関係な操作や、クリックを使った入力の誤りなど、プロセスに焦点を当てた失敗が示される。キーボード入力の誤りと画面上の位置合わせの失敗は、同じ「タスク失敗」でも対策が異なる。
- 先端モデルにも難しい。 Claude Opus 5のOSWorld-Proでの成績は75.7%で、OSWorldの83.4%を下回った。両ベンチマークの数値を完全に同列に比較することはできないが、終状態だけでは見えにくい不安定さが、手順単位の評価で表れることを示している。
意義と影響
プロセス評価は、エージェントの改善箇所を具体化する。キーボード入力の誤りが多ければ、アクションの生成、状態確認、訂正処理を見直す必要がある。クリックの失敗が中心なら、画面の視覚的な位置合わせ、座標変換、クリック後のフィードバック確認が重要になる。無関係な操作が頻発する場合は、計画、コンテキスト管理、停止判断に問題がある可能性がある。
また、最終的に正しい結果へ到達したとしても、冗長な操作や偶然に依存した経路では、画面の変化や長いタスクに弱いかもしれない。サブゴールを追跡すれば、モデルが安定して作業できているのか、それともたまたま成功しているのかを区別しやすくなる。
LLMジャッジについては、人間の評価との整合性を継続的に検証する必要がある。それでもOSWorld-Proは、CUAの評価を「成果物が正しいか」だけでなく、「どのような手順で、どれだけ信頼性高く達成したか」へ広げる試みとして重要だ。
コメント
ログイン状態を確認中…
コメントを読み込み中…