記事一覧へ戻る
モデル評価

OSWorld-Pro、コンピュータ操作エージェントを「結果」から「過程」で評価

読了目安 3 分

導入

コンピュータ操作エージェント(Computer-Use Agents、CUAs)は、キーボードやマウス、グラフィカルなユーザーインターフェースを操作し、複数の手順からなる作業を実行する。これまでの評価では、作成されたファイルや最終的な画面状態など、タスク終了時の成果物が正しいかどうかを機能検証器で判定する方法が中心だった。

しかし、最終状態だけでは、エージェントがどの段階で失敗したのか分からない。入力文字を間違えたのか、クリック位置を誤ったのか、そもそも現在の目標と関係のない操作をしたのかによって、必要な改善策は異なる。NVIDIAの研究チームが提案したOSWorld-Proは、この問題に対して手順ベースの評価を導入する。

主なポイント

  • タスクをサブゴールに分解。 OSWorld-Proは300以上のタスクと2800以上のサブゴールで構成される。各タスクを依存関係のある複数の段階として扱うことで、最終結果だけでなく、途中の進捗も追跡できる。
  • 大規模な人手アノテーションを利用。 データセットは6万7000件を超える人手アノテーションを基盤とする。さらに、人間の判断に整合するよう設計されたLLMジャッジを使い、個々のサブゴールが達成されたかを評価する。
  • 失敗の種類を切り分ける。 研究では、現在のサブゴールと無関係な操作や、クリックを使った入力の誤りなど、プロセスに焦点を当てた失敗が示される。キーボード入力の誤りと画面上の位置合わせの失敗は、同じ「タスク失敗」でも対策が異なる。
  • 先端モデルにも難しい。 Claude Opus 5のOSWorld-Proでの成績は75.7%で、OSWorldの83.4%を下回った。両ベンチマークの数値を完全に同列に比較することはできないが、終状態だけでは見えにくい不安定さが、手順単位の評価で表れることを示している。

意義と影響

プロセス評価は、エージェントの改善箇所を具体化する。キーボード入力の誤りが多ければ、アクションの生成、状態確認、訂正処理を見直す必要がある。クリックの失敗が中心なら、画面の視覚的な位置合わせ、座標変換、クリック後のフィードバック確認が重要になる。無関係な操作が頻発する場合は、計画、コンテキスト管理、停止判断に問題がある可能性がある。

また、最終的に正しい結果へ到達したとしても、冗長な操作や偶然に依存した経路では、画面の変化や長いタスクに弱いかもしれない。サブゴールを追跡すれば、モデルが安定して作業できているのか、それともたまたま成功しているのかを区別しやすくなる。

LLMジャッジについては、人間の評価との整合性を継続的に検証する必要がある。それでもOSWorld-Proは、CUAの評価を「成果物が正しいか」だけでなく、「どのような手順で、どれだけ信頼性高く達成したか」へ広げる試みとして重要だ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ディープフェイク検出が破綻するとき、画像の再構成性で真正性を認証する
モデル評価
cctest.ai
モデル評価

ディープフェイク検出が破綻するとき、画像の再構成性で真正性を認証する

新しい生成モデルや敵対的摂動によって、従来のディープフェイク検出器の信頼性は大きく低下します。研究チームは、既知の生成器が画像を忠実に再構成できるかを調べ、誤認証のリスクを校正する方法を提案しました。

続きを読む
CCTest · Blog
医療のオープンエンド回答で検索ベースの事実検証が失敗する理由
モデル評価
cctest.ai
モデル評価

医療のオープンエンド回答で検索ベースの事実検証が失敗する理由

長文の医療回答を対象にした研究は、検索してから検証するシステムがクローズドなベンチマークでは高い性能を示しても、臨床的なオープンエンド回答では大きく崩れることを示した。失敗の原因は、検索された証拠の質と検証モデルの推論過程に分けて分析できる。

続きを読む
CCTest · Blog
HyperBrowseComp、多言語・マルチモーダルなウェブ閲覧能力を試す
モデル評価
cctest.ai
モデル評価

HyperBrowseComp、多言語・マルチモーダルなウェブ閲覧能力を試す

HyperBrowseCompは、ウェブ閲覧エージェントを対象にした高難度の評価ベンチマークです。13言語と複数の証拠形式を対象に、検索結果を読むだけでなく、分散した手がかりを発見し、つなぎ合わせ、検証する能力を測ります。

続きを読む