記事一覧へ戻る
AIセーフティ

幻覚を連続スパンとして検出する時系列マルチシグナル融合

読了目安 3 分

導入

大規模言語モデルの幻覚は、必ずしも一つの明らかに怪しいトークンとして現れるわけではない。誤った主張が複数のトークンにまたがり、周辺の文脈や外部証拠との関係を合わせて初めて問題が見える場合もある。今回の研究は、トークンを独立に、しかも単一の信号で採点する従来型検出器の弱点に取り組んだ。

トークン単位から系列単位へ

提案手法では、幻覚検出を系列ラベリングとして定式化する。生成された各トークンについて、33次元の特徴ベクトルを作成する。特徴は大きく次の三つに分かれる。

  • テキスト統計:生成文そのものに現れる観測可能なパターン
  • 自然言語推論(NLI):外部証拠が回答内容を含意しているかを示す信号
  • 言語モデルのサプライザル:トークンや局所的な文脈がどの程度予測しにくいかを表す値

この特徴列を双方向ゲート付きリカレントユニット(BiGRU)で処理する。独立ロジスティック回帰とは異なり、BiGRUは前後のトークンを同時に参照できる。そのため、確信度の高い位置から得られた証拠を隣接する曖昧な位置へ伝え、個々のトークンではなく幻覚のまとまりとして判定しやすくなる。

この方法は、生成元モデルの隠れ状態やロジットを必要としない。生成テキストと外部信号だけを利用するため、クローズドソースモデルにも適用できる可能性がある。

実験結果と読み解き

RAGTruthでは、10個の乱数シードにおけるBiGRUのAUCが0.840となった。独立ロジスティック回帰ベースラインに対する改善は約11ポイントで、論文ではWilcoxon符号順位検定のp値として0.002が報告されている。制御された分解実験では、改善の中心はモデル容量の増加ではなく、トークンの順序と時間的な関係を利用した点にあると分析された。

リカレント型、状態空間モデルのMamba、アテンション型も比較されたが、性能はおおむね0.845付近の上限に近づいた。これは、現状ではアーキテクチャの交換より、入力特徴の質を高める方が重要である可能性を示している。

意義と注意点

本研究の重要な視点は、幻覚を独立した誤トークンの集合ではなく、文脈の中で連続的に現れる事象として捉えたことだ。RAGシステムの出力監査や人手レビュー向けの範囲提示に活用できる方向性である。

また、訓練時に見ていない言語モデルの出力でもAUCの低下が4%未満だったとされる。ただし、提供された情報には詳細なデータ分割や広範な領域評価は含まれていない。外部証拠の品質やNLIモデルの偏りも、実運用では検証が必要だろう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
DeepSeek Harnessの間接プロンプトインジェクション耐性を検証
AIセーフティ
cctest.ai
AIセーフティ

DeepSeek Harnessの間接プロンプトインジェクション耐性を検証

AI-Infra-Guardを用いた研究が、DeepSeek Harnessに対して1万4,560回の制御実行を行い、間接プロンプトインジェクションへの耐性を調べた。隠れたUnicode文字や偽の完了通知などが、条件によってエージェントの挙動に影響し得ることが示された。

続きを読む
CCTest · Blog
HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価
AIセーフティ
cctest.ai
AIセーフティ

HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価

HarnessRiskは、個別の攻撃手法だけでなく、エージェント・ハーネスの6つの運用段階を対象に安全性を測るベンチマークです。危険の検知や高いタスク達成度だけでは、安全な実行を保証できないことを示しました。

続きを読む
CCTest · Blog
OpenAI、顧客データを保持しない安全監視でAnthropicに対抗
AIセーフティ
cctest.ai
AIセーフティ

OpenAI、顧客データを保持しない安全監視でAnthropicに対抗

OpenAIは、一部顧客向けにPrivate Safety Processingのプレビューを開始した。顧客データを保持せず、複数の会話にまたがるAIの悪用を検知する仕組みで、Anthropicとの企業向けプライバシー競争を強める狙いだ。

続きを読む