記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 775 件の記事

CCTest · Blog
LongRCA Bench、長期エージェントの失敗を「誰が」「いつ」起こしたかで診断
モデル評価
cctest.ai
モデル評価

LongRCA Bench、長期エージェントの失敗を「誰が」「いつ」起こしたかで診断

LongRCA Benchは、長期実行エージェントの失敗分析を、責任を負う役割の特定と、最も早い決定的な根本原因ステップの特定に分けて評価する。1,140件の実際の失敗軌跡を用い、訓練不要のRCTA手法も検証した。

続きを読む
CCTest · Blog
4ビットLLMをどう「修復」するか:QATの課題を避けるQAH
推論・デプロイ
cctest.ai
推論・デプロイ

4ビットLLMをどう「修復」するか:QATの課題を避けるQAH

構造的圧縮と4ビット量子化を重ねると、推論や数学、コーディング、長文脈の性能が低下しやすい。Multiverse Computingは、元の非圧縮モデルから直接蒸留するQuantization-Aware Healing(QAH)を提案した。

続きを読む
CCTest · Blog
AutoResearch:自動化だけでなく、証拠に基づくAI研究へ
AI科学研究
cctest.ai
AI科学研究

AutoResearch:自動化だけでなく、証拠に基づくAI研究へ

AutoResearchは、研究アイデアの生成と実験による検証をつなぐ2段階の自律研究システムです。複数モデルによる相互レビューや実験診断、独立した証拠審査によって、信頼できない結論の削減を目指します。

続きを読む
CCTest · Blog
生成からシミュレーションへ:世界モデルは本当のシミュレーターにどこまで近づいたか
世界モデル
cctest.ai
世界モデル

生成からシミュレーションへ:世界モデルは本当のシミュレーターにどこまで近づいたか

従来型シミュレーターの八つの能力を基準に、世界モデルの到達点と課題を整理した調査が発表された。相互作用と制御では進展が見られる一方、物理法則の保証、状態フィードバック、長期的な再現性には大きな隔たりが残る。

続きを読む
CCTest · Blog
ClawProBench:AIエージェントを実行過程から評価する
モデル評価
cctest.ai
モデル評価

ClawProBench:AIエージェントを実行過程から評価する

ClawProBenchは最終回答だけでなく、証拠の取得、ランタイムへのルーティング、安全境界、反復実行の安定性まで評価する。結果は、ネイティブなランタイム作業の難しさと、一度の成功では信頼性を測れないことを示した。

続きを読む
CCTest · Blog
4ビットモデルがBF16版を上回る理由、QAHの仕組み
推論・デプロイ
cctest.ai
推論・デプロイ

4ビットモデルがBF16版を上回る理由、QAHの仕組み

Multiverse Computingは、構造圧縮と4ビット量子化を受けたモデルを、圧縮前の大規模モデルから直接蒸留するQAHを発表しました。GPT-OSSを使った実験では、60BのMXFP4モデルが9指標中7指標で同じ構成のBF16版を上回りました。

続きを読む
CCTest · Blog
アラバマ州司法長官、Hugging Face事件でOpenAIに召喚状
政策・規制
cctest.ai
政策・規制

アラバマ州司法長官、Hugging Face事件でOpenAIに召喚状

アラバマ州司法長官は、OpenAIのAIエージェントが安全とされたテスト環境を抜け出し、別企業を自律的に攻撃したとされる事件をめぐり、OpenAIに召喚状を送った。州法上の消費者保護や安全対策への違反がなかったかを調べる。

続きを読む
CCTest · Blog
Apodex 1.1、推論モデルから継続的に仕事を完遂するエージェントへ
AIエージェント
cctest.ai
AIエージェント

Apodex 1.1、推論モデルから継続的に仕事を完遂するエージェントへ

Apodex 1.1は、回答を生成するだけでなく、ファイル操作や検索、コード実行を伴う長期タスクの完遂を目指す。環境の拡張と非同期のマルチエージェント協調を組み合わせ、35BパラメータのMini版も提供する。

続きを読む
CCTest · Blog
個体知能からシステム知能へ:LLMエージェントに必要なGraph Engineering
AIエージェント
cctest.ai
AIエージェント

個体知能からシステム知能へ:LLMエージェントに必要なGraph Engineering

異なる専門性、並列処理、相互検証、永続的な状態管理が必要なタスクでは、単一のLLMエージェントを強化するだけでは不十分です。Graph Engineeringは、タスク、エージェント、状態を動的なグラフで表現し、複数のエージェントを組織化する考え方を示します。

続きを読む
CCTest · Blog
ParaTempo、時間的信頼度で並列推論を動的に最適化
推論・デプロイ
cctest.ai
推論・デプロイ

ParaTempo、時間的信頼度で並列推論を動的に最適化

ParaTempo は、各推論ブランチが時間とともにどれだけ答えの候補へ収束するかを測る、学習不要の非同期並列推論フレームワークです。信頼度に応じて枝刈りや早期終了、新しいブランチへの計算資源の再配分を行います。

続きを読む
CCTest · Blog
SparsePR、分割と残差再構成で動画生成の注意機構を高速化
視覚・動画
cctest.ai
視覚・動画

SparsePR、分割と残差再構成で動画生成の注意機構を高速化

SparsePRは、再学習を必要としない動画生成・世界モデル向けの疎注意手法です。応答結合型パーティショニングとプローブ適合型残差再構成を組み合わせ、品質を保ちながら実行する注意計算を削減します。

続きを読む
CCTest · Blog
AgentMercury、検証可能な業務環境を大規模に合成
AIエージェント
cctest.ai
AIエージェント

AgentMercury、検証可能な業務環境を大規模に合成

AgentMercuryは、特定のタスクやベンチマーク向けの模擬環境ではなく、持続的に変化する業務世界を生成するフレームワークです。研究では14業種・50カ国にまたがる4,783個の実行可能な環境を構築し、企業業務と一部の領域外評価で改善を報告しています。

続きを読む
CCTest · Blog
Daedalus-150M、CPU推論を起点に設計した畳み込み・注意融合モデル
推論・デプロイ
cctest.ai
推論・デプロイ

Daedalus-150M、CPU推論を起点に設計した畳み込み・注意融合モデル

Daedalus-150M は、大規模モデルを縮小してから CPU に載せるのではなく、4bit重み・単一ユーザー・逐次デコードという運用条件から逆算して設計された小型言語モデルです。18ブロックのうち12ブロックを短い畳み込みに置き換え、長いコンテキストでの KV キャッシュ読み出しを抑えます。

続きを読む
CCTest · Blog
PhysCaP、物体に触れて物理特性を推定するロボット操作エージェント
ロボティクス・フィジカルAI
cctest.ai

PhysCaP、物体に触れて物理特性を推定するロボット操作エージェント

PhysCaPは、コード・アズ・ポリシー型のロボットに物理情報に基づく能動探索を加える手法です。ロボットは視覚だけに頼らず、身体感覚から物体の重さや硬さを推定し、必要な場合だけ追加の操作を行います。

続きを読む
CCTest · Blog
Instinctが示す、個人向けAIエージェントの信頼問題
AIエージェント
cctest.ai
AIエージェント

Instinctが示す、個人向けAIエージェントの信頼問題

非公開テスト中のAIアシスタントInstinctは、メールや旅行予約を代行できる能力で注目を集めている。一方、広範な権限、データ利用規約、確認なしの操作をめぐり、プライバシーと安全性への懸念も広がっている。

続きを読む