記事一覧へ戻る
モデル評価

GMA、現実に近い複雑な作業でモバイルエージェントを評価

読了目安 3 分

モバイル端末は、マルチモーダルエージェントを評価する重要な環境になりつつある。しかし、現実のスマートフォン操作は、画面上のボタンを見つけて押すだけではない。複数の画面やアプリをまたぎ、途中で得た情報を保持し、現在の状態を確認しながら次の操作を選ぶ必要がある。こうした要件は、短い単発タスクでは見えにくいエージェントの弱点を浮かび上がらせる。

GMA(General Mobile Assistants)は、こうした課題をより正面から検証するための新しいベンチマークだ。研究チームは、AndroidWorldやMobileWorldがモバイルエージェント研究の有力な基盤である一方、アプリケーションの種類とタスク設計は、現実のモバイル利用の多様性や複雑さを十分に捉えきれていないと説明する。

GMAでは、オープンソースプロジェクトを基にした7つのアプリを導入する。対象領域には、ライフスタイル共有や旅行計画などが含まれる。さらに、原子的な単一操作から、多数の処理を順番に進める複雑なワークフローまで、300のタスクを4段階の難易度に分けて収録した。

主なポイント

  • 汎用アシスタントに近い評価: 単純なタップ、入力、画面遷移だけでなく、異なるアプリ環境でユーザーの目的を理解し、最後まで実行できるかを調べる。
  • 複雑さが性能の分岐点: 8つの先端モデルを評価した結果、タスクが複雑になるにつれて性能は大きく低下した。画面を操作できることと、現実の要求を確実に満たせることは同じではない。
  • 実行ハーネスも重要: 環境、モデル設定、タスク分類をそろえ、コンテキスト保持や明示的な状態追跡などの設計を比較した。適切な設計は、特に難しいワークフローで性能を高めたが、効果は基盤モデルによって異なった。

この結果は、モバイルエージェントの信頼性が基盤モデルだけで決まらないことを示している。履歴情報をどう保存するか、現在の状態をどう表現するか、途中の結果を確認するか、失敗時にどう立て直すかといった実行システムの設計も、最終的な成否を左右する。

したがって、評価の焦点も「正しい位置を見つけてクリックできるか」から、「モデルと実行フレームワークが協調して、開かれたユーザー要求を完了できるか」へ広げる必要がある。長いワークフローでは、計画、記憶、視覚理解、行動選択が切り離せないからだ。

開発者にとってGMAは、長い操作のどの段階で失敗するのかを特定し、コンテキスト管理や状態管理の方式を比較するための手段になる。研究者にとっては、アプリの幅とタスクの難しさを拡張したテスト環境だ。GMAが示す課題は明確である。モバイルアシスタントが日常の依頼を任せられる存在になるには、複雑なワークフローを安定して最後まで実行する能力をさらに高めなければならない。

出典:arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証
モデル評価
cctest.ai
モデル評価

UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証

UrbanGroundは、香港全域の3D地理空間データからインタラクティブな都市サンドボックスを構築し、局所的な視覚理解が長距離ナビゲーションに結び付くかを検証する。現在のMLLMは近距離の認識には強い一方、探索が長くなると方向維持や修正に課題を残す。

続きを読む
CCTest · Blog
評価結果は実際に何を証明できるのか
モデル評価
cctest.ai
モデル評価

評価結果は実際に何を証明できるのか

Inspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。

続きを読む
CCTest · Blog
Video-IFBench、動画マルチモーダルモデルの指示追従を検証
モデル評価
cctest.ai
モデル評価

Video-IFBench、動画マルチモーダルモデルの指示追従を検証

Video-IFBenchは、動画を正しく理解できるかだけでなく、視覚・音声・意味・形式・条件分岐を含む複雑な指示を守れるかを評価する。20以上の近年のMLLMを対象にした評価では、動画における指示追従の難しさが示された。

続きを読む