LLMの「同調圧力」がコンフォーマル予測を破る仕組み
導入
コンフォーマル予測は、LLMの出力に統計的な安全性の目安を加える手法として注目されている。一定の前提が成り立てば、予測集合が正解を含む割合を制御できるため、モデルが答えを出すだけでなく、いつ回答を保留し、人間に確認を求めるべきかを判断する用途にも使える。
しかし、新しいarXiv論文は、マルチエージェントLLMにおける重要な弱点を指摘した。モデルが単独で答える場合には有効なコンフォーマル証明が、他のエージェントの意見を読んだ後には無効になることがある。質問も正解も入力分布も変わらない。変わるのは、モデルが候補回答に与えるスコアの付け方である。
主なポイント
- 分布シフトではなく、採点行動の変化。 研究はこれを「スコア・メカニズムのシフト」と呼ぶ。クリーンな校正データは単独回答時の採点を表すが、他のエージェントから圧力を受けた状態は表していない。
- 誤った全会一致でカバレッジが低下。 オープンウェイトモデルと複数の選択式QAタスクを用いた実験では、alpha=0.10で校正時90%だったカバレッジが、他者が誤答を一致して支持すると74%になった。
- 平均値は選択的攻撃を隠す。 攻撃者が、証明上はまだカバーされているものの信頼度が低い問題だけを狙うと、カバレッジは87%から47%へ低下した。全体平均だけでは、この脆弱性を見落としやすい。
- 意思決定にも影響する。 不確実な場合にエスカレーションするはずのシステムが、誤った同調意見によって過剰な確信を持ち、攻撃者の回答を実行する可能性がある。
従来の修正が十分でない理由
コンフォーマル予測の一般的な対策は、校正データや閾値、信頼水準、入力分布の変化を扱う。しかし今回の問題は、質問の分布が変わったことではない。会話相手や提示された意見によって、同じモデルの採点メカニズムが変わったことにある。そのため、単独回答だけで集めた校正データを使い続けても、保証が自動的に回復するわけではない。
この点は、投票や議論、相互検証を組み込むマルチエージェント設計にとって重要だ。複数のエージェントによる一致は、通常なら信頼性を高める材料と考えられる。しかし、誤答が繰り返されると、協調は誤りを訂正する仕組みではなく、誤った確信を増幅する圧力源になりうる。
意義と影響
この研究は、コンフォーマル予測がLLMに役立たないと主張しているのではない。保証の範囲を、校正が実施された情報環境に結び付ける必要があるという指摘である。単独回答、他者の回答を読んだ場合、全員一致を見た場合など、実運用の状態ごとに評価・校正することが求められる。
安全性の評価では、平均カバレッジだけでなく、信頼度や意見の一致度で分けたサブグループ、選択的攻撃、エスカレーション動作も確認すべきだ。重要なのは「モデルが校正されているか」だけでなく、「どのような情報環境でも校正が維持されるか」である。
出典:arXiv
コメント
ログイン状態を確認中…
コメントを読み込み中…