記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 791 件の記事

CCTest · Blog
GPUは商品になるのか:AIインフラの価格を変える計算資源先物
計算資源・チップ
cctest.ai
計算資源・チップ

GPUは商品になるのか:AIインフラの価格を変える計算資源先物

GPUが希少な機器から時間単位で貸し出される生産資産へ変わる中、計算資源の価格変動に対するヘッジ需要が生まれている。CME、Silicon Data、CFTCの動きは、GPU先物が市場インフラへ進みつつあることを示す。

続きを読む
CCTest · Blog
Ramp、企業向けAIモデルルーター「Router」を開始
推論・デプロイ
cctest.ai
推論・デプロイ

Ramp、企業向けAIモデルルーター「Router」を開始

企業向け経費管理プラットフォームのRampが、複数の大規模言語モデルを1つのAPIから利用・切り替えできるAIモデルルーティングサービス「Router」を開始した。現時点では米国のみで提供され、2026年末まではルーティング料金が無料となる。

続きを読む
CCTest · Blog
暗号化された指示でGrokの安全策を回避、ユーザーデータを外部送信
AIセーフティ
cctest.ai
AIセーフティ

暗号化された指示でGrokの安全策を回避、ユーザーデータを外部送信

研究者は、ウェブページに隠された暗号文をGrokに復号させ、実行させることで、ユーザー情報やチャット履歴を攻撃者側へ送信できる可能性を示した。従来の静的な安全フィルターが、実行時の結果を十分に検査していない点が問題となっている。

続きを読む
CCTest · Blog
Slack、AIエージェントと協働できる「バイブコーディング」チャンネルを導入
AIエージェント
cctest.ai
AIエージェント

Slack、AIエージェントと協働できる「バイブコーディング」チャンネルを導入

Slackが、開発タスクごとにAIコーディングエージェントとチームが協働できるSlack Codeを発表した。コード差分の確認やHTMLプレビュー、公開前のフィードバックと承認に対応する。

続きを読む
CCTest · Blog
BinanceがAIエージェント取引を開放、管理の大部分はユーザーに委ねる
AIエージェント
cctest.ai
AIエージェント

BinanceがAIエージェント取引を開放、管理の大部分はユーザーに委ねる

Binanceは、ChatGPTやClaude Code、CursorなどのAIツールを取引・決済・ブロックチェーンサービスにつなぐAgent OSを発表した。エージェントはユーザーに代わって注文できるが、具体的なリスク管理は主にユーザーが担う。

続きを読む
CCTest · Blog
Co-RL、多様なAI群の協調で教師なし推論を実現
強化学習
cctest.ai
強化学習

Co-RL、多様なAI群の協調で教師なし推論を実現

Co-RLは、パラメータを共有しない複数モデルが互いのフィードバックから報酬を得て学習する強化学習の枠組みです。正解ラベルなしでも、テキストとマルチモーダルの推論性能を高め、自己評価型RLの崩壊リスクを抑えます。

続きを読む
CCTest · Blog
FM-Bench、AIエージェントの20年間にわたるサッカー経営を評価
モデル評価
cctest.ai
モデル評価

FM-Bench、AIエージェントの20年間にわたるサッカー経営を評価

FM-Benchは、言語モデルにサッカークラブを20年間運営させ、移籍、契約更新、投資、戦術の判断が長期的にどう作用するかを測定する。結果は、モデルの規模やトークン消費よりも、管理行動の違いが成績を左右することを示した。

続きを読む
CCTest · Blog
幻覚を連続スパンとして検出する時系列マルチシグナル融合
AIセーフティ
cctest.ai
AIセーフティ

幻覚を連続スパンとして検出する時系列マルチシグナル融合

新たな研究は、トークンを個別に判定するのではなく、幻覚を文中の連続したスパンとして扱う。テキスト統計、NLI、言語モデルのサプライザルを統合し、モデル内部にアクセスせず検出精度を高めた。

続きを読む
CCTest · Blog
Zetta、ロボットの実行中の復旧と自己進化を可能にする閉ループ基盤
ロボティクス・フィジカルAI
cctest.ai

Zetta、ロボットの実行中の復旧と自己進化を可能にする閉ループ基盤

Zetta は、基盤ポリシーを凍結したまま、実行時クリティックと復旧スキルをオンラインで進化させる具現知能向けハーネスです。行動時の介入、ロールアウト分析、検証を通過した更新を三つの時間スケールで組み合わせます。

続きを読む
CCTest · Blog
OmniScientist、原データから研究を進めるマルチモーダルAI科学者
AI科学研究
cctest.ai
AI科学研究

OmniScientist、原データから研究を進めるマルチモーダルAI科学者

OmniScientistは、文章や事前計算済み特徴量だけでなく、異種の生データを直接扱うことを目指すエンドツーエンドのAI科学者です。知覚、研究着想、実験、論文執筆を一つのパイプラインに組み込みます。

続きを読む
CCTest · Blog
ウォール街が主要AIエージェント8種を実測、Qwen Officeが首位に
AIエージェント
cctest.ai
AIエージェント

ウォール街が主要AIエージェント8種を実測、Qwen Officeが首位に

ジェフリーズのアナリストが、主要なAIエージェント8製品を5種類の実務タスクで比較し、AlibabaのQwen Officeが総合1位となった。評価はモデル性能だけでなく、実行基盤であるHarnessとタスク単価の重要性も示している。

続きを読む
CCTest · Blog
FreeToken、個人PCを大規模MoE推論の弾性基盤に
推論・デプロイ
cctest.ai
推論・デプロイ

FreeToken、個人PCを大規模MoE推論の弾性基盤に

FreeTokenは、異なる構成の個人向けハードウェアで大規模なMixture-of-Expertsモデルを動かすためのエッジネイティブな推論基盤です。PCを単なる小型GPUではなく、CPUやGPU、メモリを統合して使うプラットフォームとして捉え直します。

続きを読む
CCTest · Blog
Agent Lightning v1.0、エージェント・ハーネスを強化学習に組み込む
強化学習
cctest.ai
強化学習

Agent Lightning v1.0、エージェント・ハーネスを強化学習に組み込む

Agent Lightning v1.0は、ツール呼び出しやコンテキスト管理を担う実運用のエージェント・ハーネスを、モデルの強化学習に直接参加させる手法を提案する。6,000件の学習例と比較的少ない計算資源で、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。

続きを読む
CCTest · Blog
長期稼働するAIエージェントに万能な記憶基盤はない
メモリ・コンテキスト
cctest.ai

長期稼働するAIエージェントに万能な記憶基盤はない

多様な記憶方式を同一条件で比較した研究は、最適な記憶基盤がタスク、履歴の長さ、運用コストによって変わることを示した。単一方式の採用より、状況に応じた記憶ルーティングが重要になる。

続きを読む
CCTest · Blog
HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価
AIセーフティ
cctest.ai
AIセーフティ

HarnessRisk、エージェント・ハーネスをライフサイクル全体で評価

HarnessRiskは、個別の攻撃手法だけでなく、エージェント・ハーネスの6つの運用段階を対象に安全性を測るベンチマークです。危険の検知や高いタスク達成度だけでは、安全な実行を保証できないことを示しました。

続きを読む
CCTest · Blog
DeepSeek Harnessの間接プロンプトインジェクション耐性を検証
AIセーフティ
cctest.ai
AIセーフティ

DeepSeek Harnessの間接プロンプトインジェクション耐性を検証

AI-Infra-Guardを用いた研究が、DeepSeek Harnessに対して1万4,560回の制御実行を行い、間接プロンプトインジェクションへの耐性を調べた。隠れたUnicode文字や偽の完了通知などが、条件によってエージェントの挙動に影響し得ることが示された。

続きを読む
CCTest · Blog
数学の発見で本当のボトルネックになるのは、解くことより問題探し
AI科学研究
cctest.ai
AI科学研究

数学の発見で本当のボトルネックになるのは、解くことより問題探し

FARは、専門家が一つの問題を指定する代わりに研究方向を示し、文献検索、モデルによる試行、自動トリアージを通じて有望な数学的課題を絞り込む。組合せ論の試験では、専門家の限られたレビュー時間を重点配分する可能性が示された。

続きを読む
CCTest · Blog
Agent Skillsはなぜ効き、なぜ失敗するのか
AIエージェント
cctest.ai
AIエージェント

Agent Skillsはなぜ効き、なぜ失敗するのか

複数のベンチマーク、エージェント基盤、LLMを横断した研究は、Agent Skillsの主な効果が不足した知識の注入ではなく、ノイズの多い実行履歴を手順のアンカーへ変換することにあると示した。一方、スキル数の増加は検索精度を大きく低下させる。

続きを読む
CCTest · Blog
Agentic ESOpt:進化戦略で長期タスク型LLMエージェントを微調整
AIエージェント
cctest.ai
AIエージェント

Agentic ESOpt:進化戦略で長期タスク型LLMエージェントを微調整

Agentic ESOptは、長期的で分岐の多いエージェントの微調整に進化戦略を用いる手法を提案する。推論時に近いメモリ使用量でパラメータを探索し、モデルとコンテキストの同時最適化を目指す。

続きを読む