記事一覧へ戻る
AIセーフティ

物理認知から自己参照認知へ:エージェントAIの認知リスクを考える

読了目安 3 分

導入

大規模言語モデルを利用したエージェントは、質問に答えるだけの仕組みから、状況を理解し、計画を立て、ツールを使い、複数の手順を継続的に実行する仕組みへと変わりつつある。こうしたシステムが仕事や社会のさまざまな領域に組み込まれるほど、安全性の問いも変化する。重要なのは、モデルが課題をこなせるかだけではなく、人間が意思決定と行動の主導権を保てるかである。

上海人工知能研究所に関係する論文「Understanding Cognition-Induced Risks in Agentic AI Systems」は、この問題を認知範囲の拡大という観点から分析する。個別の失敗事例を列挙するのではなく、認知能力の広がりと、人間の主体性、自律性、制御能力へのリスクを結び付ける三層の枠組みを示している。

三つの認知レベル

  • 物理認知:環境、物体、行動の結果を理解する能力を指す。エージェントがツールや機器、業務プロセスに接続されると、誤りは単なる文章の間違いにとどまらず、外部の作業に影響し得る。人間が監督し、修正できるかが課題になる。
  • 社会認知:人の意図、関係、規範、対話の状況を扱う能力である。協働、サービス、意思決定支援にエージェントが関わると、人の判断や役割分担、自主的な選択に影響を与える可能性がある。
  • 自己参照認知:自身の状態、目標、能力、行動について処理する能力を指す。この段階では、システムが自らの運用に関わる事柄を扱う際、人間が設定した目的や境界に行動を保てるかという、より複雑な制御問題が生じる。

この分類の意義は、能力の拡大とリスクの拡大を同じ流れで捉えられる点にある。問題は、誤った出力だけから生まれるとは限らない。エージェントが物理環境、社会関係、そして自らの運用に関わる範囲を広げることで、別種のリスクが現れる。

意味と限界

論文が重視する人間の利益は、主体性、自律性、制御能力である。主体性は、重要な行動の発案者と決定者が人間であり続けることを意味する。自律性は、不透明なシステムの挙動や過度な依存によって選択が実質的に左右されないことに関わる。制御能力は、必要なときにエージェントを理解し、制約し、修正し、停止できるかを問う。

この視点から見ると、正確性、タスク達成率、拒否性能だけでは、エージェントの安全性を十分に評価できない。認知範囲の拡大に合わせて、現実の行動、人との相互作用、自身の目標や状態に関わる振る舞いも評価対象にする必要がある。論文は、各認知レベルに対応したリスク低減策と、長期的な可制御性の向上を提案する方向性を示している。

ただし、公開された素材には、論文全体の実験、事例、具体的な対策の詳細は含まれていない。そのため、本研究は特定のシステムがすでに被害を起こしたという実証報告ではなく、今後の評価、設計、ガバナンスの論点を整理する分析として読むのが適切である。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
幻覚を連続スパンとして検出する時系列マルチシグナル融合
AIセーフティ
cctest.ai
AIセーフティ

幻覚を連続スパンとして検出する時系列マルチシグナル融合

新たな研究は、トークンを個別に判定するのではなく、幻覚を文中の連続したスパンとして扱う。テキスト統計、NLI、言語モデルのサプライザルを統合し、モデル内部にアクセスせず検出精度を高めた。

続きを読む
CCTest · Blog
HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価
AIセーフティ
cctest.ai
AIセーフティ

HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価

HarnessRiskは、個別の攻撃手法だけでなく、エージェント・ハーネスの6つの運用段階を対象に安全性を測るベンチマークです。危険の検知や高いタスク達成度だけでは、安全な実行を保証できないことを示しました。

続きを読む
CCTest · Blog
DeepSeek Harnessの間接プロンプトインジェクション耐性を検証
AIセーフティ
cctest.ai
AIセーフティ

DeepSeek Harnessの間接プロンプトインジェクション耐性を検証

AI-Infra-Guardを用いた研究が、DeepSeek Harnessに対して1万4,560回の制御実行を行い、間接プロンプトインジェクションへの耐性を調べた。隠れたUnicode文字や偽の完了通知などが、条件によってエージェントの挙動に影響し得ることが示された。

続きを読む