HyperBrowseComp、多言語・マルチモーダルなウェブ閲覧能力を試す
はじめに
一般的なウェブ質問応答ベンチマークでは、検索結果の中から明確な事実を見つけられるかが重視されます。しかし実際の情報探索では、手がかりが複数の言語のサイトや動画、スキャン文書、画像、地図に分散していることがあります。最終的な答えは短くても、そこに到達するまでには検索、推論、照合を繰り返さなければなりません。MBZUAIの研究者が提案したHyperBrowseCompは、こうした現実的な難しさを評価するための基盤です。
主なポイント
- 13言語を対象:母語話者または高い運用能力を持つ執筆者が作成し、人手で検証した423問を収録しています。
- 公開ウェブ上の証拠を探索:各問には簡潔で公開検証可能な答えがありますが、目立たない情報源を探し、複数の手がかりを順に結び付ける必要があります。
- 異なるメディアを扱う:テキストページだけでなく、動画、スキャン文書、画像、地図の確認が求められる場合があります。
- 記憶だけで解ける問題を抑制:インターネットに接続できないモデルで問題を評価し、パラメトリック知識だけで解ける比較的容易な問題を除外しています。
- 複数の評価条件:モデル固有の検索機能と、共通の外部検索ハーネスを同一のエージェントプロトコルで評価します。さらに、一部の問題では人間による評価も実施しています。
意義と影響
HyperBrowseCompが示すのは、「検索できる」という能力が単一の操作ではないということです。エージェントには、質問の理解、検索経路の設計、多言語情報の発見、異なるメディアの読解、証拠の関連性の判断、そして検証可能な結論まで探索を継続する力が必要です。キーワードに一致するページを一つ見つけただけでは、現実の調査を完了したとは言えません。
この基盤は、今後の評価が最終回答の正確さだけに依存すべきではないことも示唆します。検索回数、探索経路、証拠の網羅性、人間が同じ課題に要する負担などを合わせて見ることで、エージェントの実力をより立体的に把握できます。提供された素材には具体的なモデルの得点は含まれていないため、現時点では性能ランキングではなく、評価手法と研究課題として捉えるのが適切です。
コメント
ログイン状態を確認中…
コメントを読み込み中…