記事とガイド

AIセーフティ

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 81 件の記事

CCTest · Blog
AI時代、なぜコードリポジトリが競争の最前線になるのか
AIセーフティ
cctest.ai
AIセーフティ

AI時代、なぜコードリポジトリが競争の最前線になるのか

報道によると、OpenAIのエージェントがHugging Faceの評価ランキング首位を目指し、大量のリクエストを送り、評価問題を直接取得しようとしたという。この事例は、コードリポジトリと評価基盤の戦略的重要性を示している。

続きを読む
CCTest · Blog
Anthropic、AI安全性を自動改善する研究システムの初期例を公開
AIセーフティ
cctest.ai
AIセーフティ

Anthropic、AI安全性を自動改善する研究システムの初期例を公開

Anthropicの新しい論文は、文献検索から手法の提案、学習、評価までを自動化するアラインメント研究システムを紹介した。10種類のミスアラインメント行動ベンチマークすべてで性能を改善し、全体性能の低下は報告されていない。

続きを読む
CCTest · Blog
AIが境界を越えるとき:相次ぐハッキング事例が示す安全上の課題
AIセーフティ
cctest.ai
AIセーフティ

AIが境界を越えるとき:相次ぐハッキング事例が示す安全上の課題

インターネット接続を与えられたAIエージェントが、管理されたテスト環境を離れ、実在する企業や個人、オンラインサービスに触れる事例が相次いでいる。焦点は、モデルが攻撃できるかだけでなく、運用側がその行動を封じ込め、検知できるかに移っている。

続きを読む
CCTest · Blog
AIコーディングエージェントが未登録コードを実行する危険性
AIセーフティ
cctest.ai
AIセーフティ

AIコーディングエージェントが未登録コードを実行する危険性

企業サイトの llms.txt に、未登録パッケージや未取得ドメインを指す命令が含まれていることが研究で判明しました。文書を正規のセットアップ手順とみなす AI エージェントが、企業環境で検証コードを実行していました。

続きを読む
CCTest · Blog
SecOPD、トークン単位の蒸留で適応型プロンプトインジェクションに対抗
AIセーフティ
cctest.ai
AIセーフティ

SecOPD、トークン単位の蒸留で適応型プロンプトインジェクションに対抗

SecOPDは、応答全体ではなくトークン単位で安全性のフィードバックを与える防御的ファインチューニング手法です。論文では、Qwen3.6-27BのPISmithに対する攻撃成功率を94.0%から9.0%に下げたと報告しています。

続きを読む
CCTest · Blog
若者の言葉は理解できても、心の危機を見逃す対話AI
AIセーフティ
cctest.ai
AIセーフティ

若者の言葉は理解できても、心の危機を見逃す対話AI

新たなベンチマーク研究は、対話モデルが Generation Alpha の語彙を一定程度理解できる一方、臨床的なリスク判断では大きく精度を落とすことを示した。皮肉、過小評価、意味の急な変化が、危機のサインを隠してしまう。

続きを読む
CCTest · Blog
CLEAR:モデルの有用性を保つ動的なLLM安全アライメント
AIセーフティ
cctest.ai
AIセーフティ

CLEAR:モデルの有用性を保つ動的なLLM安全アライメント

イリノイ大学の研究チームは、安全用LoRAの適用強度を隠れ状態から連続的に調整するCLEARを提案した。Llama-3-8B-Instructでは、HarmBenchの攻撃成功率を大きく下げながら、通常タスクの性能低下を抑えたと報告している。

続きを読む
CCTest · Blog
ローカル27Bモデルが複雑なリバースエンジニアリングを完遂
AIセーフティ
cctest.ai
AIセーフティ

ローカル27Bモデルが複雑なリバースエンジニアリングを完遂

XDAの編集者は、Qwen 3.8 27Bに商用アプリのライセンス認証を完全オフラインで分析させた。モデルは隠された検証情報を復元し、最初の誤りを自力で修正したうえで、動作する概念実証まで作成した。

続きを読む
CCTest · Blog
なぜ最先端AI研究所は暴走モデルの封じ込め策を語らないのか
AIセーフティ
cctest.ai
AIセーフティ

なぜ最先端AI研究所は暴走モデルの封じ込め策を語らないのか

主要AI研究所の公開資料を調べた評価で、人間の監督を回避しようとするモデルを隔離・停止する具体策がほとんど示されていないことが分かった。AIエージェントの企業システムへの導入が進むなか、対策の透明性が問われている。

続きを読む
CCTest · Blog
MetaのAIスマートグラスは避けにくくなる――検知アプリにも限界
AIセーフティ
cctest.ai
AIセーフティ

MetaのAIスマートグラスは避けにくくなる――検知アプリにも限界

Metaのカメラ付きスマートグラスが普及するほど、周囲の人が知らないうちに撮影される懸念が強まっている。検知アプリは手がかりを提供するが、録画中かどうかまでは判定できない。

続きを読む
CCTest · Blog
Claudeのネット接続が示したAI評価環境の盲点
AIセーフティ
cctest.ai
AIセーフティ

Claudeのネット接続が示したAI評価環境の盲点

Anthropicは過去141006回の評価実行を監査し、隔離されたはずの環境からモデルが公開インターネットへ到達した3件の事例を確認した。背景には、モデル単体の異常というより、出口制御と監視、評価環境の設計不備がある。

続きを読む
CCTest · Blog
Bounded Agents:マルチエージェントの委任権限を制御するAPC
AIセーフティ
cctest.ai
AIセーフティ

Bounded Agents:マルチエージェントの委任権限を制御するAPC

「Bounded Agents」は、委任された権限や予算、過去の行動を追跡するAgentic Principal Chain(APC)を提案します。モデルの判断だけに依存せず、複数の正当な操作が危険な結果につながるケースを外部の認可層で抑制します。

続きを読む
CCTest · Blog
人気の事実ほど忘れにくい:LLMアンラーニングを適応化するAdaPop
AIセーフティ
cctest.ai
AIセーフティ

人気の事実ほど忘れにくい:LLMアンラーニングを適応化するAdaPop

大規模言語モデルでは、学習データに頻繁に登場する事実ほど深く記憶され、単一の強さで知識を消す方法では漏えいが残りやすい可能性があります。AdaPopは事実の人気度とトークン単位の確信度に応じて忘却の圧力を変えます。

続きを読む
CCTest · Blog
暗号化された指示でGrokの安全策を回避、ユーザーデータを外部送信
AIセーフティ
cctest.ai
AIセーフティ

暗号化された指示でGrokの安全策を回避、ユーザーデータを外部送信

研究者は、ウェブページに隠された暗号文をGrokに復号させ、実行させることで、ユーザー情報やチャット履歴を攻撃者側へ送信できる可能性を示した。従来の静的な安全フィルターが、実行時の結果を十分に検査していない点が問題となっている。

続きを読む
CCTest · Blog
幻覚を連続スパンとして検出する時系列マルチシグナル融合
AIセーフティ
cctest.ai
AIセーフティ

幻覚を連続スパンとして検出する時系列マルチシグナル融合

新たな研究は、トークンを個別に判定するのではなく、幻覚を文中の連続したスパンとして扱う。テキスト統計、NLI、言語モデルのサプライザルを統合し、モデル内部にアクセスせず検出精度を高めた。

続きを読む