無関係な画像でもVLMの判定は揺らぐ:評価設計への警告
導入
視覚言語モデル(VLM)は、画像説明だけでなく、データラベル付け、コンテンツ審査、品質評価にも使われ始めている。人間のアノテーターを置き換えられるかを調べるには、モデルの能力と評価環境の影響を切り分けなければならない。では、「答えは文だけから決め、画像は無視する」と指示した場合、無関係な画像は本当に無害なのだろうか。
Technionの研究チームは、この問いをMIST(Misleading-Image Stress Test)で検証した。
MISTの構成
MISTには、字義通りにも比喩的にも読める表現を含む英語文200件が収録されている。各文を次の3条件で提示する。
- 対応画像:文の一方の解釈を表す画像
- 誤誘導画像:反対の解釈を表す画像
- 画像なし:文だけを提示
評価指示では、正解ラベルは文だけを根拠に決めることになっている。そのため、頑健なモデルなら3条件で同じ答えを返すはずだ。研究者は13種類のVLM審査モデルを調べ、人間のアノテーションとも比較した。
画像の内容より「存在」が効く
対応画像によってラベルが変わった割合は20.5%、誤誘導画像では19.4%だった。両者はほぼ同じで、すべてのモデルで、画像を残したまま「画像を無視せよ」という指示だけを削除した場合の11.6%より高かった。
さらに重要なのは、変化の方向である。対応画像と誤誘導画像の間で答えが変わったケースのうち、画像が示す解釈へ移動したのは37%だけだった。つまり、モデルは画像の意味に一貫して引っ張られたわけではない。画像が何を描いているかより、入力に画像があること自体が判定を揺らしたと考えられる。
画像なし、対応画像、誤誘導画像の間で、人間のラベルとの一致度も改善しなかった。別のalt-testに合格した7モデルでは影響が小さかったものの、合格しなかった6モデルを含め、現象はすべてのグループに残った。
評価設計への示唆
この研究は、VLMの代替可能性を測る結果が、モデル単体の性能とは限らないことを示す。プロンプト、モダリティの組み合わせ、画像の配置、指示文のわずかな違いが、最終ラベルに影響する可能性がある。固定した1種類の入力だけで精度や人間代替性を報告すると、評価環境が生んだ不安定さを見逃しかねない。
今後の評価では、画像なし、関連画像、矛盾する画像、無関係な画像を対照条件として組み込むべきだろう。また、正解率だけでなく、モデルが課題で許可された根拠に基づいて判断したかも確認する必要がある。
MISTの結論は、VLMが常に画像に従うということではない。無関係なモダリティは、信頼できる情報を与えなくても判断を乱し得るという点にある。したがって、代替可能性の評価対象はモデルだけでなく、モデルを取り巻く入力構成全体なのである。
コメント
ログイン状態を確認中…
コメントを読み込み中…