記事一覧へ戻る
モデル評価

無関係な画像でもVLMの判定は揺らぐ:評価設計への警告

読了目安 3 分

導入

視覚言語モデル(VLM)は、画像説明だけでなく、データラベル付け、コンテンツ審査、品質評価にも使われ始めている。人間のアノテーターを置き換えられるかを調べるには、モデルの能力と評価環境の影響を切り分けなければならない。では、「答えは文だけから決め、画像は無視する」と指示した場合、無関係な画像は本当に無害なのだろうか。

Technionの研究チームは、この問いをMIST(Misleading-Image Stress Test)で検証した。

MISTの構成

MISTには、字義通りにも比喩的にも読める表現を含む英語文200件が収録されている。各文を次の3条件で提示する。

  • 対応画像:文の一方の解釈を表す画像
  • 誤誘導画像:反対の解釈を表す画像
  • 画像なし:文だけを提示

評価指示では、正解ラベルは文だけを根拠に決めることになっている。そのため、頑健なモデルなら3条件で同じ答えを返すはずだ。研究者は13種類のVLM審査モデルを調べ、人間のアノテーションとも比較した。

画像の内容より「存在」が効く

対応画像によってラベルが変わった割合は20.5%、誤誘導画像では19.4%だった。両者はほぼ同じで、すべてのモデルで、画像を残したまま「画像を無視せよ」という指示だけを削除した場合の11.6%より高かった。

さらに重要なのは、変化の方向である。対応画像と誤誘導画像の間で答えが変わったケースのうち、画像が示す解釈へ移動したのは37%だけだった。つまり、モデルは画像の意味に一貫して引っ張られたわけではない。画像が何を描いているかより、入力に画像があること自体が判定を揺らしたと考えられる。

画像なし、対応画像、誤誘導画像の間で、人間のラベルとの一致度も改善しなかった。別のalt-testに合格した7モデルでは影響が小さかったものの、合格しなかった6モデルを含め、現象はすべてのグループに残った。

評価設計への示唆

この研究は、VLMの代替可能性を測る結果が、モデル単体の性能とは限らないことを示す。プロンプト、モダリティの組み合わせ、画像の配置、指示文のわずかな違いが、最終ラベルに影響する可能性がある。固定した1種類の入力だけで精度や人間代替性を報告すると、評価環境が生んだ不安定さを見逃しかねない。

今後の評価では、画像なし、関連画像、矛盾する画像、無関係な画像を対照条件として組み込むべきだろう。また、正解率だけでなく、モデルが課題で許可された根拠に基づいて判断したかも確認する必要がある。

MISTの結論は、VLMが常に画像に従うということではない。無関係なモダリティは、信頼できる情報を与えなくても判断を乱し得るという点にある。したがって、代替可能性の評価対象はモデルだけでなく、モデルを取り巻く入力構成全体なのである。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
AutoDataBench、AI研究エージェントの「データ知能」を測る
モデル評価
cctest.ai
モデル評価

AutoDataBench、AI研究エージェントの「データ知能」を測る

AutoDataBenchは、学習フレームワークや計算量などの要因を固定し、LLM研究エージェントが学習データを診断・整理・構築する能力を評価する制御型テストベッドです。データ介入の効果を事前に予測できるか、研究軌跡を追加学習に利用できるかも検証します。

続きを読む
CCTest · Blog
CUA-SWE、画面を見て修正を検証するソフトウェア工学エージェントを評価
モデル評価
cctest.ai
モデル評価

CUA-SWE、画面を見て修正を検証するソフトウェア工学エージェントを評価

CUA-SWEは、コード編集、コマンド実行、GUI操作、視覚的なフィードバックの確認を一つのタスクに統合するベンチマークです。コーディングエージェントとコンピュータ操作エージェントの間にある評価上の空白を埋めようとしています。

続きを読む