記事とガイド

AIセーフティ

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 81 件の記事

CCTest · Blog
フィールズ賞受賞の Tsimerman 氏が OpenAI へ、AI 安全研究に転身
AIセーフティ
cctest.ai
AIセーフティ

フィールズ賞受賞の Tsimerman 氏が OpenAI へ、AI 安全研究に転身

OSChina の要約によると、2026 年のフィールズ賞受賞者に選ばれた Jacob Tsimerman 氏が、AI 安全研究へ軸足を移し OpenAI に加わると表明した。基礎数学のトップ人材が AI 安全へ流入していることを示す動きだ。

続きを読む
CCTest · Blog
AIエージェント時代、クラウド請求アラートはなぜ間に合わないのか
AIセーフティ
cctest.ai
AIセーフティ

AIエージェント時代、クラウド請求アラートはなぜ間に合わないのか

AWS の複数事例は、AI エージェントや生成 AI 用の認証情報が暴走・漏えいした場合、請求データの反映前に高額費用が発生し得ることを示している。従来型の予算アラートだけでは、API 速度の消費を止めにくい。

続きを読む
CCTest · Blog
TikTok、AIによる肖像の無断利用を検出するツールをテスト
AIセーフティ
cctest.ai
AIセーフティ

TikTok、AIによる肖像の無断利用を検出するツールをテスト

TikTokは、一部の米国クリエイター向けに、AI生成コンテンツが本人の肖像を無断で使っていないかを検出する任意参加型ツールをテストしている。利用にはJumioを通じた本人確認が必要になる。

続きを読む
CCTest · Blog
Hugging Face、AIエージェント主導の侵入を公表:防御も機械速度へ
AIセーフティ
cctest.ai
AIセーフティ

Hugging Face、AIエージェント主導の侵入を公表:防御も機械速度へ

Hugging Faceは、同社の本番インフラの一部に対する侵入を公表し、その攻撃が自律型AIエージェントシステムによって実行されたと説明した。入口はデータセット処理パイプラインであり、AI基盤の攻撃面が広がっていることを示す事例だ。

続きを読む
CCTest · Blog
AI時代のペネトレーションテストは「侵害」から「行動の失敗」へ
AIセーフティ
cctest.ai
AIセーフティ

AI時代のペネトレーションテストは「侵害」から「行動の失敗」へ

arXiv の論文は、AI 搭載システムのペネトレーションテストでは、インフラ侵害だけでなく、攻撃者が AI の行動を誘導して運用目標を破らせられるかを評価すべきだと提案している。

続きを読む
CCTest · Blog
監査の選択履歴が内部告発者を露出するリスクと差分プライバシー
AIセーフティ
cctest.ai
AIセーフティ

監査の選択履歴が内部告発者を露出するリスクと差分プライバシー

arXiv の新論文は、監査対象の選び方そのものが内部告発者の手がかりになり得る問題を形式化した。著者らは、継続的カウントに基づく私的監査メカニズムを提案している。

続きを読む
CCTest · Blog
LLM型侵入検知に向けたトラフィック認識型ランダム化平滑化
AIセーフティ
cctest.ai
AIセーフティ

LLM型侵入検知に向けたトラフィック認識型ランダム化平滑化

arXiv の新論文は、LLM ベースのネットワーク侵入検知に可証明なロバスト性を与える TA-RS を提案している。特徴量全体ではなく、攻撃者が直接操作できるトラフィック特徴だけにガウスノイズを注入する点が特徴だ。

続きを読む
CCTest · Blog
CAVA:エージェントAIの行動を検証可能にする標準化レイヤー
AIセーフティ
cctest.ai
AIセーフティ

CAVA:エージェントAIの行動を検証可能にする標準化レイヤー

arXiv 論文は、異なる実行環境に散らばるエージェントの操作記録を、標準化された行動オブジェクトへ変換する CAVA を提案している。狙いは、承認・実行証拠・事後検証が同じ行動を指していることを確認できるようにすることだ。

続きを読む
CCTest · Blog
OpenAIのGPT-Redとは何か:自動レッドチームでAIの堅牢性を高める試み
AIセーフティ
cctest.ai
AIセーフティ

OpenAIのGPT-Redとは何か:自動レッドチームでAIの堅牢性を高める試み

OpenAIは、プロンプトインジェクションなどの脆弱性を大規模に見つける内部向け自動レッドチームモデル GPT-Red を公開した。自己対戦型の強化学習により、攻撃と防御を同時に進化させる仕組みだ。

続きを読む