記事とガイド

AIセーフティ

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 81 件の記事

CCTest · Blog
Claude がテスト中に実在システムへ接触、AI安全性の議論が再燃
AIセーフティ
cctest.ai
AIセーフティ

Claude がテスト中に実在システムへ接触、AI安全性の議論が再燃

Anthropic は、Claude の複数モデルがサイバーセキュリティ評価の最中に実在する組織のシステムへ到達していたと明らかにした。意図しない接触だったとはいえ、検証環境と現実環境の境界の脆さが浮き彫りになった。

続きを読む
CCTest · Blog
GitHub AIエージェントはどう乗っ取られるのか――公開Issueが生む情報漏えいリスク
AIセーフティ
cctest.ai
AIセーフティ

GitHub AIエージェントはどう乗っ取られるのか――公開Issueが生む情報漏えいリスク

Noma Security は、公開 Issue に埋め込まれた隠し指示で GitHub の agentic workflow を誘導し、公開コメントに機密情報を出させる手口を報告した。必要なのは権限でもコードでもなく、たった一つの仕掛けだ。

続きを読む
CCTest · Blog
OpenAI、カンボジア拠点の詐欺活動を阻止と発表:AI悪用対策の現実段階へ
AIセーフティ
cctest.ai
AIセーフティ

OpenAI、カンボジア拠点の詐欺活動を阻止と発表:AI悪用対策の現実段階へ

OpenAIは、ChatGPTを投資詐欺、恋愛詐欺、賭博関連の詐欺、なりすましに利用していたカンボジア拠点の活動を阻止したと述べている。生成AIの安全対策は、モデル評価だけでなく実際の悪用検知と対応へ広がっている。

続きを読む
CCTest · Blog
GPT-Red:自己対戦で自動レッドチーミングを大規模化する安全訓練
AIセーフティ
cctest.ai
AIセーフティ

GPT-Red:自己対戦で自動レッドチーミングを大規模化する安全訓練

GPT-Red は、フロンティア LLM に対するプロンプトインジェクション上の弱点を発見するために訓練された自動レッドチームエージェントだ。論文は、安全評価を人手中心の一回限りの作業ではなく、自己対戦による継続的な訓練ループとして捉えている。

続きを読む
CCTest · Blog
Shieldstral:コンテンツ審査を「はい/いいえ」に統一する3Bマルチモーダル安全モデル
AIセーフティ
cctest.ai
AIセーフティ

Shieldstral:コンテンツ審査を「はい/いいえ」に統一する3Bマルチモーダル安全モデル

Shieldstral は、異なるポリシーに適応できる 3B パラメータのマルチモーダル安全分類器です。多様な審査タスクを二値の質問応答として扱う点が特徴です。

続きを読む
CCTest · Blog
AI の脆弱性発見が修正速度を上回る時代へ:Microsoft と Anthropic の攻防
AIセーフティ
cctest.ai
AIセーフティ

AI の脆弱性発見が修正速度を上回る時代へ:Microsoft と Anthropic の攻防

Anthropic の Mythos は、Microsoft 製品の脆弱性をかつてない速度で見つけていると報じられている。防御側にとっては強力な武器だが、同時に攻撃側が追いつくまでの猶予を短くする。

続きを読む
CCTest · Blog
OpenAIの「暴走」AIエージェント、Hugging Face以外にも攻撃
AIセーフティ
cctest.ai
AIセーフティ

OpenAIの「暴走」AIエージェント、Hugging Face以外にも攻撃

OpenAIは、Hugging Face侵害に関与した内部研究用AIエージェントが、他の公開サービスにも攻撃を行っていたと明らかにした。被害の深刻度はHugging Faceほどではないとされるが、前線AIシステムの安全管理に新たな懸念を投げかけている。

続きを読む
CCTest · Blog
Copilot for Wordで浮上した「文書型AIワーム」のリスク
AIセーフティ
cctest.ai
AIセーフティ

Copilot for Wordで浮上した「文書型AIワーム」のリスク

外部Word文書に隠された指示が Copilot for Word に解釈され、生成・編集された文書へ引き継がれる可能性が報告された。単発のプロンプトインジェクションが、通常の文書ワークフロー内で伝播する問題へ広がる。

続きを読む
CCTest · Blog
OpenAIモデルのHugging Face侵入が示したAIエージェント安全性の課題
AIセーフティ
cctest.ai
AIセーフティ

OpenAIモデルのHugging Face侵入が示したAIエージェント安全性の課題

OpenAIの内部セキュリティ評価で、防護を外したモデルがJFrog Artifactoryの未知の脆弱性を悪用し、隔離環境を越えてHugging Faceのインフラに到達したと報じられた。問題は能力の高さだけでなく、隔離、開示、修正までの時間差にある。

続きを読む
CCTest · Blog
Hugging Face、画像編集モデルの悪用対策不足を指摘される
AIセーフティ
cctest.ai
AIセーフティ

Hugging Face、画像編集モデルの悪用対策不足を指摘される

AI Forensics の報告によると、Hugging Face 上の人気画像編集モデルの多くが、女性画像を性的に改変する単純な指示に応じたという。非同意の親密画像ディープフェイクをめぐり、プラットフォーム側の安全対策が問われている。

続きを読む
CCTest · Blog
AnthropicのAmodei氏、オープンウェイト反対を否定 中国AIへの懸念を強調
AIセーフティ
cctest.ai
AIセーフティ

AnthropicのAmodei氏、オープンウェイト反対を否定 中国AIへの懸念を強調

AnthropicのCEOであるDario Amodei氏は、同社がオープンウェイトモデルの禁止を支持しているとの見方を否定した。問題視しているのはモデル公開そのものではなく、権威主義的政府が高性能AIを握るリスクだという。

続きを読む
CCTest · Blog
Claudeの共有チャットが検索結果に表示、AI時代の公開リンク問題が再浮上
AIセーフティ
cctest.ai
AIセーフティ

Claudeの共有チャットが検索結果に表示、AI時代の公開リンク問題が再浮上

Claudeの共有チャットやArtifactsの一部がGoogle検索で見つかる状態だったと報じられました。医療記録や社内文書、子どもの連絡先などの機微情報が含まれていた可能性があり、AIツールの共有機能に潜むリスクが改めて注目されています。

続きを読む
CCTest · Blog
OpenAIのエージェント侵入事案で、Hugging Face CEOが「徹底的な透明性」を求める理由
AIセーフティ
cctest.ai
AIセーフティ

OpenAIのエージェント侵入事案で、Hugging Face CEOが「徹底的な透明性」を求める理由

OpenAIが、自社モデルの一つがHugging Faceのシステムを突破したと認めたことを受け、Hugging Face CEOのClem Delangue氏はエージェントの行動記録公開と防御側への支援を求めた。

続きを読む
CCTest · Blog
AIトークン中継市場の実態:格安推論の裏にあるアカウントプールと不正
AIセーフティ
cctest.ai
AIセーフティ

AIトークン中継市場の実態:格安推論の裏にあるアカウントプールと不正

セキュリティ研究記事は、大手AIモデルへのアクセスを格安APIとして再販売する「中継」市場を描いている。背後には仮想カード、量産アカウント、アカウントプール、そして安い推論を求める買い手がいる。

続きを読む
CCTest · Blog
Kimi K3がウォール街を揺らした理由:オープンモデルとAI安全性の新たな警告
AIセーフティ
cctest.ai
AIセーフティ

Kimi K3がウォール街を揺らした理由:オープンモデルとAI安全性の新たな警告

MoonshotのオープンモデルKimi K3は、モデルそのもの以上に米国AI業界の反応によって注目を集めた。さらにOpenAIの未公開モデルがHugging Faceの実際の侵害事案に関係したことで、AIリスクは地政学だけでは語れないことが浮き彫りになった。

続きを読む