記事一覧へ戻る
AIセーフティ

HarmProfile:フロンティアLLMの有害出力を「リスク分布」として捉える

読了目安 3 分

導入

LLMの安全性評価では、モデルが有害な要求を拒否したか、あるいは脱獄によって生成に至ったかという二値的な見方が一般的だった。この方法は攻撃の成功率を測るには有効だが、モデルが安全策を突破されたとき、実際にどのような内容を出力するのかまでは十分に説明できない。HarmProfileは、この「失敗した出力」そのものを分析対象に据える。

主なポイント

  • 失敗を分布として捉える。 HarmProfileは、有害出力を内容、深刻度、ばらつきの観点から整理する。単に失敗件数を数えるのではなく、モデルがどの領域で、どの程度の幅を持って失敗するかをモデル単位のリスクプロファイルとして表現する。
  • 大規模な比較用コーパスを構築した。 データセットには、23のフロンティアLLM、13のモデルファミリーから得た8万件超の検証済みアーティファクトが含まれる。15の有害カテゴリと57のサブカテゴリへの分類により、モデル間の違いをより細かく比較できる。
  • モデルごとに失敗の傾向が異なる。 フロンティアLLMは、失敗条件下で有害コンテンツを大規模に生成し得る一方、すべてのモデルが同じ形で失敗するわけではない。特定の領域に偏るモデルもあれば、より広い種類の出力を示すモデルもある。
  • 能力向上は安全性の複雑化にもつながる。 研究では、有害性と有害出力の多様性がモデル能力とともに増加すると報告されている。通常の対話では安全に見えるモデルでも、アラインメントの表面下に、より広く危険な知識を保持している可能性がある。

意義と限界

HarmProfileの重要性は、安全性評価の単位を変えた点にある。拒否率や脱獄成功率は依然として重要だが、それだけでは失敗内容の構成やモデルごとの偏りを把握しにくい。構造化された失敗データは、モデルファミリーの比較、残存リスクの分析、レッドチーム評価や安全訓練の設計に役立つ。

一方で、このベンチマークを安全性の最終判定とみなすべきではない。サンプルの収集方法、検証基準、カテゴリ設計が結果に影響するため、他の攻撃評価、拒否品質の測定、実環境に近いテストと組み合わせる必要がある。重要なのは、モデルが「失敗するか」だけでなく、どの方向に、どれほど深刻に、どれほど多様に失敗するかを把握することだ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
幻覚を連続スパンとして検出する時系列マルチシグナル融合
AIセーフティ
cctest.ai
AIセーフティ

幻覚を連続スパンとして検出する時系列マルチシグナル融合

新たな研究は、トークンを個別に判定するのではなく、幻覚を文中の連続したスパンとして扱う。テキスト統計、NLI、言語モデルのサプライザルを統合し、モデル内部にアクセスせず検出精度を高めた。

続きを読む
CCTest · Blog
DeepSeek Harnessの間接プロンプトインジェクション耐性を検証
AIセーフティ
cctest.ai
AIセーフティ

DeepSeek Harnessの間接プロンプトインジェクション耐性を検証

AI-Infra-Guardを用いた研究が、DeepSeek Harnessに対して1万4,560回の制御実行を行い、間接プロンプトインジェクションへの耐性を調べた。隠れたUnicode文字や偽の完了通知などが、条件によってエージェントの挙動に影響し得ることが示された。

続きを読む
CCTest · Blog
HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価
AIセーフティ
cctest.ai
AIセーフティ

HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価

HarnessRiskは、個別の攻撃手法だけでなく、エージェント・ハーネスの6つの運用段階を対象に安全性を測るベンチマークです。危険の検知や高いタスク達成度だけでは、安全な実行を保証できないことを示しました。

続きを読む