記事一覧へ戻る
AIセーフティ

LLMの「同調圧力」がコンフォーマル予測を破る仕組み

読了目安 3 分

導入

コンフォーマル予測は、LLMの出力に統計的な安全性の目安を加える手法として注目されている。一定の前提が成り立てば、予測集合が正解を含む割合を制御できるため、モデルが答えを出すだけでなく、いつ回答を保留し、人間に確認を求めるべきかを判断する用途にも使える。

しかし、新しいarXiv論文は、マルチエージェントLLMにおける重要な弱点を指摘した。モデルが単独で答える場合には有効なコンフォーマル証明が、他のエージェントの意見を読んだ後には無効になることがある。質問も正解も入力分布も変わらない。変わるのは、モデルが候補回答に与えるスコアの付け方である。

主なポイント

  • 分布シフトではなく、採点行動の変化。 研究はこれを「スコア・メカニズムのシフト」と呼ぶ。クリーンな校正データは単独回答時の採点を表すが、他のエージェントから圧力を受けた状態は表していない。
  • 誤った全会一致でカバレッジが低下。 オープンウェイトモデルと複数の選択式QAタスクを用いた実験では、alpha=0.10で校正時90%だったカバレッジが、他者が誤答を一致して支持すると74%になった。
  • 平均値は選択的攻撃を隠す。 攻撃者が、証明上はまだカバーされているものの信頼度が低い問題だけを狙うと、カバレッジは87%から47%へ低下した。全体平均だけでは、この脆弱性を見落としやすい。
  • 意思決定にも影響する。 不確実な場合にエスカレーションするはずのシステムが、誤った同調意見によって過剰な確信を持ち、攻撃者の回答を実行する可能性がある。

従来の修正が十分でない理由

コンフォーマル予測の一般的な対策は、校正データや閾値、信頼水準、入力分布の変化を扱う。しかし今回の問題は、質問の分布が変わったことではない。会話相手や提示された意見によって、同じモデルの採点メカニズムが変わったことにある。そのため、単独回答だけで集めた校正データを使い続けても、保証が自動的に回復するわけではない。

この点は、投票や議論、相互検証を組み込むマルチエージェント設計にとって重要だ。複数のエージェントによる一致は、通常なら信頼性を高める材料と考えられる。しかし、誤答が繰り返されると、協調は誤りを訂正する仕組みではなく、誤った確信を増幅する圧力源になりうる。

意義と影響

この研究は、コンフォーマル予測がLLMに役立たないと主張しているのではない。保証の範囲を、校正が実施された情報環境に結び付ける必要があるという指摘である。単独回答、他者の回答を読んだ場合、全員一致を見た場合など、実運用の状態ごとに評価・校正することが求められる。

安全性の評価では、平均カバレッジだけでなく、信頼度や意見の一致度で分けたサブグループ、選択的攻撃、エスカレーション動作も確認すべきだ。重要なのは「モデルが校正されているか」だけでなく、「どのような情報環境でも校正が維持されるか」である。

出典:arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
間接プロンプトインジェクションを「テスト時探索」として捉え直す
AIセーフティ
cctest.ai
AIセーフティ

間接プロンプトインジェクションを「テスト時探索」として捉え直す

新たなarXiv論文は、間接プロンプトインジェクションを被害エージェントだけの静的な脆弱性として扱うべきではないと論じています。攻撃者がどのように攻撃面を探索し、どれだけのテスト時計算資源を使えるかが、攻撃結果を左右します。

続きを読む
CCTest · Blog
高性能モデルはシステムを危険にするのか?LLMエージェントの逆説
AIセーフティ
cctest.ai
AIセーフティ

高性能モデルはシステムを危険にするのか?LLMエージェントの逆説

金融市場のエージェントシミュレーションを用いた研究で、高性能な言語モデルほど行動が似通う可能性が示されました。共通の判断が正しければリスク低減につながりますが、誤情報を共有すると損失を増幅する可能性があります。

続きを読む
CCTest · Blog
Geminiで登山計画を立てた3人、シャスタ山で救助される
AIセーフティ
cctest.ai
AIセーフティ

Geminiで登山計画を立てた3人、シャスタ山で救助される

米カリフォルニア州のシャスタ山で、Google Geminiを使って行程を計画した3人のハイカーが救助された。一般用途のAIによる助言を、現地の公式情報や安全判断の代わりにしてはならないことを示す事例だ。

続きを読む