記事一覧へ戻る
AIセーフティ

幻覚を連続スパンとして検出する時系列マルチシグナル融合

読了目安 3 分

導入

大規模言語モデルの幻覚は、必ずしも一つの明らかに怪しいトークンとして現れるわけではない。誤った主張が複数のトークンにまたがり、周辺の文脈や外部証拠との関係を合わせて初めて問題が見える場合もある。今回の研究は、トークンを独立に、しかも単一の信号で採点する従来型検出器の弱点に取り組んだ。

トークン単位から系列単位へ

提案手法では、幻覚検出を系列ラベリングとして定式化する。生成された各トークンについて、33次元の特徴ベクトルを作成する。特徴は大きく次の三つに分かれる。

  • テキスト統計:生成文そのものに現れる観測可能なパターン
  • 自然言語推論(NLI):外部証拠が回答内容を含意しているかを示す信号
  • 言語モデルのサプライザル:トークンや局所的な文脈がどの程度予測しにくいかを表す値

この特徴列を双方向ゲート付きリカレントユニット(BiGRU)で処理する。独立ロジスティック回帰とは異なり、BiGRUは前後のトークンを同時に参照できる。そのため、確信度の高い位置から得られた証拠を隣接する曖昧な位置へ伝え、個々のトークンではなく幻覚のまとまりとして判定しやすくなる。

この方法は、生成元モデルの隠れ状態やロジットを必要としない。生成テキストと外部信号だけを利用するため、クローズドソースモデルにも適用できる可能性がある。

実験結果と読み解き

RAGTruthでは、10個の乱数シードにおけるBiGRUのAUCが0.840となった。独立ロジスティック回帰ベースラインに対する改善は約11ポイントで、論文ではWilcoxon符号順位検定のp値として0.002が報告されている。制御された分解実験では、改善の中心はモデル容量の増加ではなく、トークンの順序と時間的な関係を利用した点にあると分析された。

リカレント型、状態空間モデルのMamba、アテンション型も比較されたが、性能はおおむね0.845付近の上限に近づいた。これは、現状ではアーキテクチャの交換より、入力特徴の質を高める方が重要である可能性を示している。

意義と注意点

本研究の重要な視点は、幻覚を独立した誤トークンの集合ではなく、文脈の中で連続的に現れる事象として捉えたことだ。RAGシステムの出力監査や人手レビュー向けの範囲提示に活用できる方向性である。

また、訓練時に見ていない言語モデルの出力でもAUCの低下が4%未満だったとされる。ただし、提供された情報には詳細なデータ分割や広範な領域評価は含まれていない。外部証拠の品質やNLIモデルの偏りも、実運用では検証が必要だろう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
元OpenAI安全担当者、AIに「原発級」の安全対策を求める
AIセーフティ
cctest.ai
AIセーフティ

元OpenAI安全担当者、AIに「原発級」の安全対策を求める

主要モデルの公開に伴う安全報告書を作成していたDavid Robinson氏がOpenAIを退職し、AI業界の企業文化を公に批判した。 同氏は、最先端AI研究所には原子力発電所や空港のような多層的な安全対策が必要だと訴えている。

続きを読む