記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 795 件の記事

CCTest · Blog
Metis:基盤モデルに「ネイティブ記憶」を組み込む試み
メモリ・コンテキスト
cctest.ai

Metis:基盤モデルに「ネイティブ記憶」を組み込む試み

Metis は、AI エージェントの記憶を外部検索やプロンプト構築から、モデル内部の持続的な状態へ移す「記憶基盤モデル」を提案する。履歴をコンパクトな状態に圧縮し、後続の計算で直接利用できる点が特徴だ。

続きを読む
CCTest · Blog
Chimera:長尺動画生成に向けたハイブリッド視覚拡散モデル
拡散モデル
cctest.ai
拡散モデル

Chimera:長尺動画生成に向けたハイブリッド視覚拡散モデル

Chimera は、高解像度画像や長尺動画の生成で問題になる全注意機構の計算コストを抑えるための、ハイブリッド型視覚拡散バックボーンです。KDA、MLA、短い畳み込み、疎な MoE、そして HeteroP というスケーリング手法を組み合わせています。

続きを読む
CCTest · Blog
OpenAI、カンボジア拠点の詐欺活動を阻止と発表:AI悪用対策の現実段階へ
AIセーフティ
cctest.ai
AIセーフティ

OpenAI、カンボジア拠点の詐欺活動を阻止と発表:AI悪用対策の現実段階へ

OpenAIは、ChatGPTを投資詐欺、恋愛詐欺、賭博関連の詐欺、なりすましに利用していたカンボジア拠点の活動を阻止したと述べている。生成AIの安全対策は、モデル評価だけでなく実際の悪用検知と対応へ広がっている。

続きを読む
CCTest · Blog
AIエージェントは開かれたAI研究を進められるのか:2つの影評価が示す初期証拠
モデル評価
cctest.ai
モデル評価

AIエージェントは開かれたAI研究を進められるのか:2つの影評価が示す初期証拠

新論文は、未発表論文の中心的な研究課題をAIエージェントに任せ、元の著者が評価する「シャドー評価」を提案した。結果は、現在のエージェントが工学的作業をこなせても、開かれた研究判断にはまだ弱いことを示している。

続きを読む
CCTest · Blog
StealthBench:攻撃的セキュリティAIの“隠密性”を測る新ベンチマーク
モデル評価
cctest.ai
モデル評価

StealthBench:攻撃的セキュリティAIの“隠密性”を測る新ベンチマーク

StealthBench は、自律型セキュリティエージェントを「脆弱性を見つけられるか」だけでなく、「痕跡やリスクを増やさずに実行できるか」で評価する。結果は、現行モデルに OPSEC 上の課題が残ることを示している。

続きを読む
CCTest · Blog
SecRespond:侵害後のインシデント対応で AI エージェントを評価する新ベンチマーク
モデル評価
cctest.ai
モデル評価

SecRespond:侵害後のインシデント対応で AI エージェントを評価する新ベンチマーク

SecRespond は、侵害済みホストのフォレンジック調査、リスク特定、修復計画を AI エージェントに求める評価基準です。結果は、現行モデルが明示的なアラートには対応できても、静かな侵入の発見や完全な修復計画では苦戦することを示しています。

続きを読む
CCTest · Blog
Apple、高頻度AI利用向けにiCloud Plus上位枠を示唆
プロダクト・アプリ
cctest.ai

Apple、高頻度AI利用向けにiCloud Plus上位枠を示唆

Tim Cook氏は、Apple Intelligenceと新しいSiri AIを多く使うユーザー向けに、iCloud Plusで利用量を増やす選択肢を用意する可能性を示した。AppleのAI機能は、サブスクリプション事業とより強く結びつくかもしれない。

続きを読む
CCTest · Blog
米判事、Anthropicの「サプライチェーンリスク」指定に証拠不足を指摘
政策・規制
cctest.ai
政策・規制

米判事、Anthropicの「サプライチェーンリスク」指定に証拠不足を指摘

米連邦判事は、トランプ政権が Anthropic を「サプライチェーンリスク」とみなし、連邦政府による同社AI技術の利用を禁じる根拠を十分に示していないと述べた。この訴訟は、AI企業の利用制限と政府調達、軍事利用の境界を問うものだ。

続きを読む
CCTest · Blog
LinkedInが「AIスロップ」通報ボタンを追加、AI代筆機能も見直しへ
プロダクト・アプリ
cctest.ai

LinkedInが「AIスロップ」通報ボタンを追加、AI代筆機能も見直しへ

LinkedInは、低品質なAI生成投稿をユーザーが通報できる「seems like AI slop」オプションを導入する。あわせて、自社のAI投稿作成支援を校正中心の機能へ置き換える。

続きを読む
CCTest · Blog
Gemini Robotics ER 2、動画理解とタスク編成でロボットを高度化
ロボティクス・フィジカルAI
cctest.ai

Gemini Robotics ER 2、動画理解とタスク編成でロボットを高度化

Google DeepMind は、ロボット向けの高レベルな具身推論モデル Gemini Robotics ER 2 を発表した。リアルタイムの動画理解、ツール編成、複数ロボットの協調を重視したアップデートだ。

続きを読む
CCTest · Blog
MCPがステートレス化、企業導入で最大の壁だった拡張性に対応
フレームワーク・ツール
cctest.ai

MCPがステートレス化、企業導入で最大の壁だった拡張性に対応

Model Context Protocol(MCP)は、これまでで最大級の仕様更新を行い、プロトコルの中核をステートレスなリクエスト/レスポンス型へ移行した。狙いは、企業環境で求められる信頼性、拡張性、運用の予測可能性を高めることにある。

続きを読む
CCTest · Blog
AlphaFoldチームが独立組織でなくなる:GoogleはGemini基盤の科学AIへ
AI科学研究
cctest.ai
AI科学研究

AlphaFoldチームが独立組織でなくなる:GoogleはGemini基盤の科学AIへ

報道によると、DeepMindの旧AlphaFoldチームは独立したチームとしては存続していない。メンバーはGemini、AIコーディング、生命科学、核融合、Isomorphic Labsなどへ分散し、一部はAnthropicへ移った。

続きを読む
CCTest · Blog
TurboVLA:1GB未満のVRAMでリアルタイム動作するVLAモデル
ロボティクス・フィジカルAI
cctest.ai

TurboVLA:1GB未満のVRAMでリアルタイム動作するVLAモデル

TurboVLAは、VLAモデルで一般的なLLM中心の経路を見直し、視覚と言語からより直接的にロボット動作を生成する設計を提案する。論文ではRTX 4090上で0.9GBの推論VRAM、約32Hz相当の動作が報告されている。

続きを読む
CCTest · Blog
GPT-Red:自己対戦で自動レッドチーミングを大規模化する安全訓練
AIセーフティ
cctest.ai
AIセーフティ

GPT-Red:自己対戦で自動レッドチーミングを大規模化する安全訓練

GPT-Red は、フロンティア LLM に対するプロンプトインジェクション上の弱点を発見するために訓練された自動レッドチームエージェントだ。論文は、安全評価を人手中心の一回限りの作業ではなく、自己対戦による継続的な訓練ループとして捉えている。

続きを読む