記事一覧へ戻る
AI科学研究

OSWorld-Science、AIエージェントの科学ソフト利用能力を評価

読了目安 3 分

研究用ソフトウェアをAIに操作させる場合、単に画面を見てボタンを押せればよいわけではありません。エージェントは専門的なインターフェースや用語を理解し、分子、画像、シミュレーション条件などの科学的対象を扱い、最後に検証可能な結果を作成する必要があります。OSWorld-Scienceは、この一連の能力を測るためのベンチマークと評価環境です。

科学ワークフローを対象にする

OSWorld-Scienceには146のタスクがあり、複数の科学分野とソフトウェア構成を対象に、12の視覚言語モデルを評価します。分子描画と逆合成、病理画像解析、統計計算、物理シミュレーションなどが含まれます。一般的なデスクトップ操作の成否ではなく、科学的な目的に沿って一連の作業を完了できるかを問う点が特徴です。

タスクは専門家の提案を出発点とし、人間とAIによる反復的な共同設計を経て作成されます。その後、科学的価値と難易度を基準に選定されます。これにより、研究ソフトウェアらしい見た目だけを再現した問題ではなく、実際の研究上の目標に近い評価を目指しています。

操作履歴ではなく成果物を検査

タスクごとの実行ベース評価器は、スクリーンショットやクリック履歴だけでなく、アプリケーションの状態と生成物を調べます。具体的には、次のような成果物が対象になります。

  • 要求に合った分子構造
  • 病理画像のセグメンテーションマスク
  • 統計分析から得られたグラフ
  • 計算やシミュレーションの数値結果

ワークフローの一部しか完了できなかった場合も、部分点を与えられます。この仕組みによって、指示の理解、ソフトウェア操作、最終成果物の生成のどこで失敗したのかを、単純な合否より細かく分析できます。

モデルだけでなくハーネスも評価対象

研究チームは、モデルアダプター、インタラクションループの制御、軌跡の記録を統合したエージェント用ハーネスも提供します。これにより、モデルの比較に加えて、計画方法、操作を続ける判断、文脈の扱いといった実行基盤の影響も調べられます。

報告された結果では、強力なハーネスを組み合わせても、現在の先端VLMは重要な科学タスクでなお苦戦しています。多言語入力、推論への投入量、コンテキスト長などの要因も分析されています。ただし、提供された素材にはモデル別の詳細スコアやタスクごとの失敗例がないため、特定分野でどのモデルが最良かまでは判断できません。

意義と今後

OSWorld-Scienceは、専門家が定義した科学目標、ソフトウェア上の実行、検証可能な成果物を一つの評価の流れに結び付けます。科学向けエージェントは、画面を操作できるだけでなく、得られた構造、マスク、グラフ、数値が目的に合っているかまで問われるべきです。

今後、現実的なタスクと信頼できる評価器が追加されれば、汎用的なコンピューター利用と、研究を支援できるエージェントとの隔たりをより明確に測定できるでしょう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事