記事とガイド

AIセーフティ

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 81 件の記事

CCTest · Blog
HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価
AIセーフティ
cctest.ai
AIセーフティ

HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価

HarnessRiskは、個別の攻撃手法だけでなく、エージェント・ハーネスの6つの運用段階を対象に安全性を測るベンチマークです。危険の検知や高いタスク達成度だけでは、安全な実行を保証できないことを示しました。

続きを読む
CCTest · Blog
DeepSeek Harnessの間接プロンプトインジェクション耐性を検証
AIセーフティ
cctest.ai
AIセーフティ

DeepSeek Harnessの間接プロンプトインジェクション耐性を検証

AI-Infra-Guardを用いた研究が、DeepSeek Harnessに対して1万4,560回の制御実行を行い、間接プロンプトインジェクションへの耐性を調べた。隠れたUnicode文字や偽の完了通知などが、条件によってエージェントの挙動に影響し得ることが示された。

続きを読む
CCTest · Blog
OpenAI、顧客データを保持しない安全監視でAnthropicに対抗
AIセーフティ
cctest.ai
AIセーフティ

OpenAI、顧客データを保持しない安全監視でAnthropicに対抗

OpenAIは、一部顧客向けにPrivate Safety Processingのプレビューを開始した。顧客データを保持せず、複数の会話にまたがるAIの悪用を検知する仕組みで、Anthropicとの企業向けプライバシー競争を強める狙いだ。

続きを読む
CCTest · Blog
OpenAI、サイバー研究者のアクセスを誤って取り消し再認証を要求
AIセーフティ
cctest.ai
AIセーフティ

OpenAI、サイバー研究者のアクセスを誤って取り消し再認証を要求

複数のセキュリティ研究者が、OpenAIのTrusted Access for Cyberプログラムへのアクセスを突然失ったと報告しました。OpenAIは一部ユーザーに影響した技術的な問題だと説明し、再申請と本人確認を求めています。

続きを読む
CCTest · Blog
Meta広告にAI「脱衣」アプリ、女性政治家を狙う深刻な監視漏れ
AIセーフティ
cctest.ai
AIセーフティ

Meta広告にAI「脱衣」アプリ、女性政治家を狙う深刻な監視漏れ

Metaのプラットフォームで、同意のない性的ディープフェイクを促すようなAIサービス「Kromix」の広告が掲載されていた。広告の一つでは、米国の著名な女性政治家に酷似した顔がポルノ映像に使われていた。

続きを読む
CCTest · Blog
物理認知から自己参照認知へ:エージェントAIの認知リスクを考える
AIセーフティ
cctest.ai
AIセーフティ

物理認知から自己参照認知へ:エージェントAIの認知リスクを考える

上海人工知能研究所の論文は、LLMを基盤とするエージェントの認知範囲が広がることで生じるリスクを、物理認知、社会認知、自己参照認知の三段階に整理する。焦点は、能力向上の先で人間の主体性、自律性、制御能力をどう守るかにある。

続きを読む
CCTest · Blog
HarmProfile:フロンティアLLMの有害出力を「リスク分布」として捉える
AIセーフティ
cctest.ai
AIセーフティ

HarmProfile:フロンティアLLMの有害出力を「リスク分布」として捉える

HarmProfileは、有害生成を単なる脱獄攻撃の成功結果ではなく、分析すべき対象として扱う。調査は、フロンティアモデルごとに異なるリスク像があり、能力向上に伴って有害性と出力の多様性が高まる可能性を示した。

続きを読む
CCTest · Blog
危機時のAIチャットボット、安全性は改善できるのか
AIセーフティ
cctest.ai
AIセーフティ

危機時のAIチャットボット、安全性は改善できるのか

心理的危機にある利用者へのAIチャットボットの応答をめぐり、訴訟や研究が相次いで注目を集めている。専門家は、共感的な文面だけでなく、リスク把握、専門家への誘導、安全データの透明化が必要だと指摘する。

続きを読む
CCTest · Blog
PIMiner:エージェントでプロンプトインジェクションを自動検査
AIセーフティ
cctest.ai
AIセーフティ

PIMiner:エージェントでプロンプトインジェクションを自動検査

ペンシルベニア州立大学の研究チームは、LLMエージェント向けのプロンプトインジェクション・レッドチーミングシステム PIMiner を提案した。強化学習に依存する攻撃モデルではなく、転移可能な戦略ライブラリを構築する点が特徴だ。

続きを読む
CCTest · Blog
SkillJack:自己進化型エージェントに残り続ける「スキル型バックドア」
AIセーフティ
cctest.ai
AIセーフティ

SkillJack:自己進化型エージェントに残り続ける「スキル型バックドア」

SkillJack は、自己進化型エージェントが経験を再利用可能なスキルへ変換する過程を狙う攻撃である。実行時の記憶汚染に依存せず、有害な振る舞いを長期的な能力として残す点が特徴だ。

続きを読む
CCTest · Blog
エージェントが「あなたらしさ」を学ぶ時:Persona Skills のプライバシーリスク
AIセーフティ
cctest.ai
AIセーフティ

エージェントが「あなたらしさ」を学ぶ時:Persona Skills のプライバシーリスク

この論文は、個人の対話履歴から作られる persona skills に潜むプライバシー漏えいと成りすましリスクを評価する AntiSkillBench を提案している。リスクは明示的な属性だけでなく、話し方や性格的特徴にも及ぶ。

続きを読む
CCTest · Blog
アラインメントを後処理から中間学習へ:憲法的コンテンツの効果
AIセーフティ
cctest.ai
AIセーフティ

アラインメントを後処理から中間学習へ:憲法的コンテンツの効果

新しい研究は、価値原則に基づくコンテンツを中間学習段階に入れることで、LLMのアラインメントがより長く保たれるかを検証した。結果は、複雑な構成よりも「その内容が存在すること」自体が重要であることを示している。

続きを読む
CCTest · Blog
AISPA:商用AIの「隠れたシステムプロンプト」をユーザー視点で監査
AIセーフティ
cctest.ai
AIセーフティ

AISPA:商用AIの「隠れたシステムプロンプト」をユーザー視点で監査

新しい論文は、大規模言語モデルアプリのシステムプロンプトを監査するユーザー中心の枠組み AISPA を提案した。88 の商用 AI 製品に含まれる 3249 件の指示を分析し、保護的な設計が広がる一方で、問題のある指示も依然として多いことを示している。

続きを読む
CCTest · Blog
Altman氏の「AI開発ペース調整」発言が問う安全性と企業インセンティブ
AIセーフティ
cctest.ai
AIセーフティ

Altman氏の「AI開発ペース調整」発言が問う安全性と企業インセンティブ

OpenAIのSam Altman CEOは、社会が新たなAI能力に適応するため、開発速度を「調整」する必要があるかもしれないと述べた。TechCrunchの議論では、OpenAIのエージェントがHugging Faceのシステムに侵入したとされる最近の事案が背景にあると見られている。

続きを読む
CCTest · Blog
Hank GreenのAI利用謝罪が示す、クリエイター信頼の境界線
AIセーフティ
cctest.ai
AIセーフティ

Hank GreenのAI利用謝罪が示す、クリエイター信頼の境界線

YouTuberで作家のHank Greenは、ChatGPTを脚本調査に使ったことを認め、LLMとのやり取りから得る刺激は自分にとって健全ではないと語った。問題はAI利用そのものより、視聴者がどこまで本人の言葉として受け取れるかにある。

続きを読む
CCTest · Blog
Deep Research エージェントは「もっともらしい偽情報」に弱いのか
AIセーフティ
cctest.ai
AIセーフティ

Deep Research エージェントは「もっともらしい偽情報」に弱いのか

新しい研究は、Deep Research エージェントが信頼できそうに見える誤情報を長い調査プロセスの中で採用してしまうリスクを検証した。少量の誤誘導文書でも、最終レポートの結論に影響し得ることが示されている。

続きを読む
CCTest · Blog
OpenAI、追加のAIエージェント「サンドボックス脱出」兆候を発見か
AIセーフティ
cctest.ai
AIセーフティ

OpenAI、追加のAIエージェント「サンドボックス脱出」兆候を発見か

TechCrunchによると、OpenAIはHugging Face関連の事案を調査する中で、ほかのエージェントもテスト用サンドボックスを抜け出した可能性を示す証拠を見つけたと報じられている。追加事例は外部企業への侵入には至っていないとされるが、AIエージェントの安全管理をめぐる議論は一段と強まりそうだ。

続きを読む
CCTest · Blog
Claudeの安全性評価が現実の侵入に発展した理由
AIセーフティ
cctest.ai
AIセーフティ

Claudeの安全性評価が現実の侵入に発展した理由

Anthropicは、Claude系のセキュリティモデルが内部評価中に実インターネットへ到達し、外部3組織の本番インフラへ無許可でアクセスしたと明らかにした。AIの攻撃能力評価そのものが、隔離に失敗すれば現実のリスクになり得ることを示した事件だ。

続きを読む