記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 775 件の記事

CCTest · Blog
Anthropic、AI安全性を自動改善する研究システムの初期例を公開
AIセーフティ
cctest.ai
AIセーフティ

Anthropic、AI安全性を自動改善する研究システムの初期例を公開

Anthropicの新しい論文は、文献検索から手法の提案、学習、評価までを自動化するアラインメント研究システムを紹介した。10種類のミスアラインメント行動ベンチマークすべてで性能を改善し、全体性能の低下は報告されていない。

続きを読む
CCTest · Blog
オープンウェイトAI企業がシリコンバレーの買収標的になる理由
オープンソース
cctest.ai
オープンソース

オープンウェイトAI企業がシリコンバレーの買収標的になる理由

Hugging Face、Poolside、OpenRouterを巡る大型取引の報道は、オープンウェイトAIが単なるモデル共有ではなく、重要なインフラ事業になりつつあることを示している。半導体企業やソフトウェア企業は、開発者と推論の入り口を競い始めた。

続きを読む
CCTest · Blog
米連邦判事、トランプ政権によるAnthropic排除を違法と判断
政策・規制
cctest.ai
政策・規制

米連邦判事、トランプ政権によるAnthropic排除を違法と判断

Anthropicが致死性の自律兵器や米国民の大規模監視への利用制限を緩和しなかったことを受け、トランプ政権が同社を政府調達から排除した措置について、連邦判事が違法な報復だったと判断した。

続きを読む
CCTest · Blog
米EPA、データセンターの大気汚染に対する住民監視を弱める可能性
政策・規制
cctest.ai
政策・規制

米EPA、データセンターの大気汚染に対する住民監視を弱める可能性

米環境保護庁(EPA)は、一部の「小規模」汚染源について、連邦レベルでの公示と意見募集を不要にする規則変更を提案している。環境団体は、データセンターや関連発電設備が地域住民の十分な監視なしに建設される可能性を懸念している。

続きを読む
CCTest · Blog
LinkedInが複数エージェントでAIコードレビューを大規模化
コーディングAI
cctest.ai
コーディングAI

LinkedInが複数エージェントでAIコードレビューを大規模化

LinkedInは既製のAIレビューツールをそのまま導入するのではなく、複数のレビューエージェントと組織固有のルールを組み合わせた基盤を構築した。狙いはコメント数の最大化ではなく、幻覚や低価値な指摘を抑え、開発者に採用されるレビューを増やすことにある。

続きを読む
CCTest · Blog
Cloudflare、AIエージェント向け軽量ブラウザーエンジン「Kitesurf」を発表
AIエージェント
cctest.ai
AIエージェント

Cloudflare、AIエージェント向け軽量ブラウザーエンジン「Kitesurf」を発表

Cloudflareは、HTML抽出やスクリーンショットなどの自動化処理を想定した実験的なブラウザーエンジン「Kitesurf」を公開した。Chromiumの代替にはまだ至らないが、AIエージェント向けにブラウザーの役割を絞り込む試みだ。

続きを読む
CCTest · Blog
ゲーム開発は世界モデルの検証可能なデータエンジンになるか
世界モデル
cctest.ai
世界モデル

ゲーム開発は世界モデルの検証可能なデータエンジンになるか

新しい論文は、世界モデルの拡張にはウェブ動画の追加だけでなく、根拠のある報酬信号を継続的に生む仕組みが必要だと論じています。ゲームエンジンは、空間モデルの強化学習後学習に実行可能な環境と長期軌跡を提供できる可能性があります。

続きを読む
CCTest · Blog
Metaのインド・東南アジア責任者、OpenAIへ移籍 アジア展開を強化
業界動向
cctest.ai
業界動向

Metaのインド・東南アジア責任者、OpenAIへ移籍 アジア展開を強化

Metaのインド・東南アジア担当副社長サンディヤ・デヴァナタン氏が、10年以上在籍したMetaを離れ、OpenAIに加わる。東南アジアとオーストラリアで消費者成長、企業導入、提携、規制対応を統括する。

続きを読む
CCTest · Blog
テンセント混元、770Bパラメータと100万コンテキストのHy4 previewを公開
モデルリリース
cctest.ai
モデルリリース

テンセント混元、770Bパラメータと100万コンテキストのHy4 previewを公開

テンセント混元が、総パラメータ770B、アクティブパラメータ4.9B、コンテキスト長100万のHy4 previewを発表した。複数のプラットフォームで公開され、ゲームエンジンやMCPとの連携を含むエージェント用途も示されている。

続きを読む
CCTest · Blog
Claudeが物理世界へ:Anthropic、MHSハードウェア標準を発表
ロボティクス・フィジカルAI
cctest.ai

Claudeが物理世界へ:Anthropic、MHSハードウェア標準を発表

Anthropicは、AIエージェントがロボットアームや顕微鏡、実験機器を発見・操作するための「Model Hardware Standard(MHS)」研究プレビューを公開した。Claudeに固定された身体を与えるのではなく、接続された機器を必要に応じて使う発想だ。

続きを読む
CCTest · Blog
高徳がABot-Reconを公開、12フレームで万フレーム級の3D再構築
視覚・動画
cctest.ai
視覚・動画

高徳がABot-Reconを公開、12フレームで万フレーム級の3D再構築

高徳は、直近12フレームの局所コンテキストだけを使って長い映像から3Dシーンを逐次再構築するモデル「ABot-Recon」を発表した。長期記憶への依存を避け、誤差の蓄積や推論速度の低下、メモリ使用量の増大に対応する設計を採用している。

続きを読む
CCTest · Blog
JIT-Agent、タスクごとにエージェントの実行基盤を即時生成
AIエージェント
cctest.ai
AIエージェント

JIT-Agent、タスクごとにエージェントの実行基盤を即時生成

JIT-Agentは、エージェントの記憶、計画、行動プロトコル、ツール連携を生成可能な実行基盤として扱う。タスクに応じたカスタマイズだけでなく、失敗時の修復と過去の設定からの進化も目指す。

続きを読む
CCTest · Blog
Video-IFBench、動画マルチモーダルモデルの指示追従を検証
モデル評価
cctest.ai
モデル評価

Video-IFBench、動画マルチモーダルモデルの指示追従を検証

Video-IFBenchは、動画を正しく理解できるかだけでなく、視覚・音声・意味・形式・条件分岐を含む複雑な指示を守れるかを評価する。20以上の近年のMLLMを対象にした評価では、動画における指示追従の難しさが示された。

続きを読む
CCTest · Blog
AnTrapが明らかにするAndroid GUIエージェントの実行時の脆弱性
モデル評価
cctest.ai
モデル評価

AnTrapが明らかにするAndroid GUIエージェントの実行時の脆弱性

AnTrapは、解決可能なAndroidタスクの実行途中に現実的な実行時異常を注入し、GUIエージェントの頑健性を評価する。調査では多くのモデルで性能が低下し、学習で修正できる罠と、深い推論限界に由来する失敗が分かれた。

続きを読む