記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 795 件の記事

CCTest · Blog
SceneActBench:VLMエージェントは見た3Dシーンで行動できるのか
モデル評価
cctest.ai
モデル評価

SceneActBench:VLMエージェントは見た3Dシーンで行動できるのか

SceneActBench は、3Dシーンを説明するだけでなく、その中で正しく行動できるかを評価する新しいベンチマークです。画像や動画フレームを入力に、VLMエージェントの空間理解と行動生成を幾何指標で検証します。

続きを読む
CCTest · Blog
生成動画に「再訪の記憶」を与える:学習不要の一貫性改善手法
視覚・動画
cctest.ai
視覚・動画

生成動画に「再訪の記憶」を与える:学習不要の一貫性改善手法

この論文は、3D 条件付きの長尺動画生成で起きる再訪時の見た目の不一致に注目する。過去の潜在表現を KV cache に戻し、深度とカメラ姿勢による幾何対応で注意機構を導くことで、追加学習なしに一貫性を高める。

続きを読む
CCTest · Blog
Ant Bailing、Agent 向け効率重視の混合推論モデル Ling-3.0-Flash を発表
モデルリリース
cctest.ai
モデルリリース

Ant Bailing、Agent 向け効率重視の混合推論モデル Ling-3.0-Flash を発表

Ant Bailing は、新世代のネイティブ混合推論モデル Ling-3.0-Flash を発表した。総パラメータ数は 124B、単回計算での活性化パラメータは 5.1B とされ、Agent 実行、長文処理、低コスト推論を重視している。

続きを読む
CCTest · Blog
脳波はフィジカルAIの次の訓練データになるのか
ロボティクス・フィジカルAI
cctest.ai

脳波はフィジカルAIの次の訓練データになるのか

ロボット向けAIの課題は、モデルそのものよりも高品質な現実世界データの不足に移りつつある。Encord は、脳波、主観視点映像、詳細アノテーションを組み合わせた新しい訓練データ作りを試している。

続きを読む
CCTest · Blog
vLLM、Kimi K3 の Day-0 推論サポートを公開
推論・デプロイ
cctest.ai
推論・デプロイ

vLLM、Kimi K3 の Day-0 推論サポートを公開

vLLM は Kimi K3 の重み公開に合わせ、混合 KDA プレフィックスキャッシュ、DSpark 投機的デコード、分離型デプロイ、NVIDIA・AMD GPU 向け最適化を含む推論サポートを発表した。焦点はモデルを読み込むことではなく、巨大なハイブリッド MoE を実運用に近づけることにある。

続きを読む
CCTest · Blog
Wattage:AIエージェントのToken浪費をCIで検知するプロファイラ
フレームワーク・ツール
cctest.ai

Wattage:AIエージェントのToken浪費をCIで検知するプロファイラ

Wattageは、AIエージェントの実行トレースを読み取り、token消費の無駄を実コストに換算して示すオープンソースツールです。CIに組み込むことで、エージェントのコスト回帰をマージ前に検出できます。

続きを読む
CCTest · Blog
OpenAIのエージェント侵入事案で、Hugging Face CEOが「徹底的な透明性」を求める理由
AIセーフティ
cctest.ai
AIセーフティ

OpenAIのエージェント侵入事案で、Hugging Face CEOが「徹底的な透明性」を求める理由

OpenAIが、自社モデルの一つがHugging Faceのシステムを突破したと認めたことを受け、Hugging Face CEOのClem Delangue氏はエージェントの行動記録公開と防御側への支援を求めた。

続きを読む
CCTest · Blog
AIトークン中継市場の実態:格安推論の裏にあるアカウントプールと不正
AIセーフティ
cctest.ai
AIセーフティ

AIトークン中継市場の実態:格安推論の裏にあるアカウントプールと不正

セキュリティ研究記事は、大手AIモデルへのアクセスを格安APIとして再販売する「中継」市場を描いている。背後には仮想カード、量産アカウント、アカウントプール、そして安い推論を求める買い手がいる。

続きを読む
CCTest · Blog
触覚データを具身知能の基盤へ:NeoteAI と復旦大学の N0 シリーズ
ロボティクス・フィジカルAI
cctest.ai

触覚データを具身知能の基盤へ:NeoteAI と復旦大学の N0 シリーズ

NeoteAI と復旦大学可信具身智能研究院は、触覚データ、視覚・触覚・言語・行動モデル、触覚世界モデルに関する N0 シリーズの技術報告を公開した。ロボットが物理世界で安定して動くには、視覚だけでは不十分だという問題意識が中心にある。

続きを読む
CCTest · Blog
Cloudflare、AIトラフィックを検索・エージェント・学習に分類
業界動向
cctest.ai
業界動向

Cloudflare、AIトラフィックを検索・エージェント・学習に分類

Cloudflareは、AIボットを一括で扱う従来の管理から、用途別に制御する方針へ移行する。検索、エージェント、学習という3分類により、サイト運営者はより細かくアクセスを許可・遮断できるようになる。

続きを読む
CCTest · Blog
倒れた送電線が示した、AIデータセンター時代の電力網リスク
計算資源・チップ
cctest.ai
計算資源・チップ

倒れた送電線が示した、AIデータセンター時代の電力網リスク

ワシントンDC近郊の送電線トラブルは停電には至らなかったが、PJM電力網に大きな電圧変動を起こした。背景には、北バージニアのデータセンター群がほぼ同時にバックアップ電源へ切り替わったことがある。

続きを読む
CCTest · Blog
Andrew Ng氏のOpenWorker、デスクトップ型AIエージェントをオープンソース化
AIエージェント
cctest.ai
AIエージェント

Andrew Ng氏のOpenWorker、デスクトップ型AIエージェントをオープンソース化

Andrew Ng氏が公開した OpenWorker は、会話だけでなく成果物の作成を目指すデスクトップAIエージェントだ。オープンソース、ローカル優先、プライバシー保護、モデル非依存を特徴としている。

続きを読む
CCTest · Blog
Vivix A1発表:仮想キャラクターをリアルタイムに「聞いて動く」存在へ
マルチモーダル
cctest.ai
マルチモーダル

Vivix A1発表:仮想キャラクターをリアルタイムに「聞いて動く」存在へ

Vivixはリアルタイム対話型マルチモーダルモデルA1を発表し、あわせて物語世界への介入を狙うW1にも言及した。焦点は動画生成の画質だけでなく、継続的に反応し行動する仮想キャラクターにある。

続きを読む
CCTest · Blog
Tencent WorkBuddy Bench:コーディングエージェントを実務目線で測る新ベンチマーク
モデル評価
cctest.ai
モデル評価

Tencent WorkBuddy Bench:コーディングエージェントを実務目線で測る新ベンチマーク

Tencent WorkBuddy Bench は、コード、Web、オフィス業務、セキュリティの4領域でコーディングエージェントを評価するベンチマークです。公開・再現可能でありながら、タスク構築によってデータ汚染への耐性を高めている点が特徴です。

続きを読む