記事一覧へ戻る
モデル評価

見たものを正確に実行できるか:EASELが試すマルチモーダルエージェント

読了目安 3 分

導入:理解と実行の間にある壁

マルチモーダルモデルは、画像に関する質問へ答えたり、ブラウザやGUI、ソフトウェアツールを操作したりできるようになっている。しかし、画像を理解できることと、視覚的な根拠に基づいて細かな作業を正確に続けられることは同じではない。精密なタスクでは、位置、色、サイズ、軌跡などを推定し、行動を実行し、その結果を再び見て次の操作を決める必要がある。一度の小さなずれが、最終結果全体に影響する。

論文「Paint What You See」は、この能力を「器用な視覚ツール使用」と位置付け、EASELというベンチマークを提案した。主課題では、エージェントが参照画像を見ながら、パラメータ化された描画操作を積み重ね、キャンバスを目標に近づけていく。

主なポイント

  • 中心は参照画像の再構成。 エージェントは画像から描画操作を選び、各ステップ後に結果を確認して修正する。ツールのパラメータは単なる呼び出し情報ではなく、完成画像を直接左右する。
  • 複数の精密タスクを含む。 EASELには、領域アノテーション、手書き、経路計画も含まれる。これにより、位置の特定、軌跡の制御、構造化された視覚行動を別々に調べられる。
  • 弱点は認識だけではない。 25モデルの評価では、再構成類似度は0.40〜0.54にとどまった。軌跡の分析では、初期段階で改善した後、後続操作によって品質が低下するケースが目立った。
  • 軌跡データは改善をもたらす。 研究チームは、二段階のカリキュラムで構成した440,000サンプルのEASEL-Dataを提供した。これで訓練したEASEL-9Bは、ベースモデルに対して相対6.3%向上し、評価モデル中3位となった。

意義と影響

既存のエージェント評価は、ページを開けたか、フォームを入力できたか、コードを生成できたかといった、タスク完了の有無を重視することが多い。こうした指標は高水準の計画能力を見るには有効だが、視覚的な判断を安定した行動へ変換できたかまでは十分に表さない。EASELは最終成果物だけでなく、そこへ至る軌跡も分析することで、「何をすべきか分かる」ことと「正しく実行できる」ことを分離している。

この視点は、画像質問応答に強いモデルが、精密な注釈や経路計画では苦戦する理由を理解するうえでも重要だ。視覚情報は最初に与える文脈ではなく、各行動の結果を評価し、誤りから回復するための制御信号でなければならない。

EASEL-9Bの改善は、専用の軌跡監督によって能力を伸ばせる可能性を示す。一方で、改善幅だけで問題が解決したわけではない。長い操作列での安定性、誤差の回復、未知のツールへの一般化は、今後も検討が必要である。

GUIエージェント、創作ソフトウェアの支援システム、ロボットなどが環境を直接変えるようになるほど、「見た結果を受けて次の行動を正確に選べるか」という評価は重要になる。EASELは、その閉ループ能力を分かりやすく可視化する試みだ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LoopArena、コーディングエージェントの長期制御能力を評価
モデル評価
cctest.ai
モデル評価

LoopArena、コーディングエージェントの長期制御能力を評価

LoopArenaは、コーディングエージェントを動かす制御ループを切り出し、別のモデルが長期的なソフトウェア開発をどれだけ適切に導けるかを測定するベンチマークです。結果は、長期的で信頼できる制御が依然として難しいことを示しています。

続きを読む
CCTest · Blog
GMA、現実に近い複雑な作業でモバイルエージェントを評価
モデル評価
cctest.ai
モデル評価

GMA、現実に近い複雑な作業でモバイルエージェントを評価

新しいベンチマーク「GMA」は、オープンソースプロジェクトを基にした7つのアプリと300のタスクで、単一操作から複数ステップのワークフローまでモバイルエージェントを検証する。タスクが複雑になるほど性能は大きく低下する一方、コンテキスト保持や状態追跡を含むハーネス設計が一部の難しいタスクを改善できることが示された。

続きを読む
CCTest · Blog
評価結果は実際に何を証明できるのか
モデル評価
cctest.ai
モデル評価

評価結果は実際に何を証明できるのか

Inspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。

続きを読む