記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 795 件の記事

CCTest · Blog
DataPrep-Bench:LLMの「訓練データ準備能力」を下流性能で測る
モデル評価
cctest.ai
モデル評価

DataPrep-Bench:LLMの「訓練データ準備能力」を下流性能で測る

DataPrep-Bench は、LLM、エージェント、データ中心ワークフローが訓練データをどれだけ有効に準備できるかを評価するベンチマークです。表面的な文章品質ではなく、下流の訓練効果を基準にしています。

続きを読む
CCTest · Blog
IDEAgent:研究アイデア生成を品質と多様性の探索として捉える
AI科学研究
cctest.ai
AI科学研究

IDEAgent:研究アイデア生成を品質と多様性の探索として捉える

IDEAgent は、LLM による研究アイデア生成で品質と多様性が別々に最適化されがちな問題に取り組む。複数エージェント、アイデアの系譜管理、Yield 指標を組み合わせ、有用で重複の少ない候補群を目指す。

続きを読む
CCTest · Blog
ソニーの SPA、スペクトル事前分布で拡散モデルの Exposure Bias を軽減
拡散モデル
cctest.ai
拡散モデル

ソニーの SPA、スペクトル事前分布で拡散モデルの Exposure Bias を軽減

ソニーの研究チームは、拡散モデルとフローマッチングモデルの推論時誤差を周波数領域で補正する Spectral Alignment(SPA)を提案した。事前に学習したスペクトル先験を使い、中間予測のパワースペクトルを軽量に校正する。

続きを読む
CCTest · Blog
Agent の記憶は検索だけではない:ACM が文脈管理をライフサイクル問題として再定義
メモリ・コンテキスト
cctest.ai

Agent の記憶は検索だけではない:ACM が文脈管理をライフサイクル問題として再定義

この論文は Agentic Context Management(ACM)を提案し、本番環境のエージェント失敗の多くは推論能力ではなく、推論コンテキストの管理不全にあると論じている。

続きを読む
CCTest · Blog
MicrosoftのAIセキュリティエージェント、低コストと高性能を主張する一方で残る懸念
AIエージェント
cctest.ai
AIエージェント

MicrosoftのAIセキュリティエージェント、低コストと高性能を主張する一方で残る懸念

Microsoftは、脆弱性の発見・評価・修正を支援するMAI-Cyber-1-FlashとProject Perceptionを発表した。ベンチマークとコスト面での優位性を掲げるが、AIエージェントの制御リスクは依然として重要な論点だ。

続きを読む
CCTest · Blog
ナデラ氏が警告:AIを1社のモデルに丸投げする企業は生き残れない可能性
AIエージェント
cctest.ai
AIエージェント

ナデラ氏が警告:AIを1社のモデルに丸投げする企業は生き残れない可能性

Microsoft CEOのサティア・ナデラ氏は、企業がデータ、プロンプト、文脈、記憶、エージェントツールを単一のAIモデル提供者に委ねることは、自社の思考を外部化することに近いと警告した。企業にはAIゲートウェイやマルチモデル構成による主導権の確保が求められる。

続きを読む
CCTest · Blog
Claudeの共有チャットが検索結果に表示、AI時代の公開リンク問題が再浮上
AIセーフティ
cctest.ai
AIセーフティ

Claudeの共有チャットが検索結果に表示、AI時代の公開リンク問題が再浮上

Claudeの共有チャットやArtifactsの一部がGoogle検索で見つかる状態だったと報じられました。医療記録や社内文書、子どもの連絡先などの機微情報が含まれていた可能性があり、AIツールの共有機能に潜むリスクが改めて注目されています。

続きを読む
CCTest · Blog
GoogleとRedditのDMCA戦略が後退、AI時代のウェブ取得規制に一石
政策・規制
cctest.ai
政策・規制

GoogleとRedditのDMCA戦略が後退、AI時代のウェブ取得規制に一石

Googleは検索結果のスクレイピングを止めるためDMCAを持ち出したが、裁判所は早い段階でSerpApi側の却下申立てを認めた。AI時代のデータ取得をめぐり、公開ウェブの境界が改めて問われている。

続きを読む
CCTest · Blog
CursorのSQLite実験:AIコーディングの焦点はモデル性能からエージェント編成へ
AIエージェント
cctest.ai
AIエージェント

CursorのSQLite実験:AIコーディングの焦点はモデル性能からエージェント編成へ

Cursorは、835ページのSQLiteマニュアルだけを与えたエージェント群にRust製データベースエンジンを実装させた。注目点は成果物そのものより、計画役と実装役を分けたときのコストと品質の差にある。

続きを読む
CCTest · Blog
NVIDIA Cosmos-H-Dreams、外科ロボット向け世界モデルをリアルタイム化
世界モデル
cctest.ai
世界モデル

NVIDIA Cosmos-H-Dreams、外科ロボット向け世界モデルをリアルタイム化

NVIDIA は、外科ロボット向けのアクション条件付き生成シミュレータ Cosmos-H-Dreams を公開した。Cosmos-H-Surgical-Simulator の能力を因果的な少ステップ学生モデルへ蒸留し、FlashDreams でストリーミング推論する構成だ。

続きを読む
CCTest · Blog
AWSがLoomを公開:企業向けAIエージェント基盤のリファレンス実装
AIエージェント
cctest.ai
AIエージェント

AWSがLoomを公開:企業向けAIエージェント基盤のリファレンス実装

AWSは、企業規模でAIエージェントを構築・展開・管理するためのオープンソース参考プラットフォーム「Loom」をAWS Labsで公開した。焦点は、ID伝播、権限制御、登録管理、人間による承認フローにある。

続きを読む
CCTest · Blog
原生マルチモーダル事前学習に Scaling Law を適用する研究
マルチモーダル
cctest.ai
マルチモーダル

原生マルチモーダル事前学習に Scaling Law を適用する研究

Tencent Hunyuan の論文は、固定計算予算の下で原生マルチモーダル事前学習をどう拡張すべきかを検証している。言語目標とマルチモーダル目標では、最適な資源配分の振る舞いが異なるという点が重要だ。

続きを読む
CCTest · Blog
Molt:エージェント型強化学習向けの PyTorch ネイティブ訓練基盤
強化学習
cctest.ai
強化学習

Molt:エージェント型強化学習向けの PyTorch ネイティブ訓練基盤

Molt は、エージェント型強化学習研究における実装変更の負担を下げるために設計された PyTorch ネイティブの訓練フレームワークです。軽量なコードベースを保ちながら、非同期訓練、多モーダル方策、MoE 方策を扱える点を特徴とします。

続きを読む