記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 775 件の記事

CCTest · Blog
GigaBrain-0.7、三システム構成で具現知能の汎化を拡張
ロボティクス・フィジカルAI
cctest.ai

GigaBrain-0.7、三システム構成で具現知能の汎化を拡張

GigaBrain-0.7は、視覚言語理解、世界予測、ロボット行動を結び付ける三システム構成を提案する具現知能モデルです。3万7,000時間超の異種データで事前学習し、異なるロボット本体やタスクへの汎化を目指します。

続きを読む
CCTest · Blog
AutoSaddler、失敗軌跡からLLMエージェントの実行基盤を自動改善
AIエージェント
cctest.ai
AIエージェント

AutoSaddler、失敗軌跡からLLMエージェントの実行基盤を自動改善

AutoSaddlerは、エージェントのハーネス最適化をオフライン学習として扱う手法です。実行軌跡の診断、構造化されたパッチ生成、検証による更新選択を組み合わせ、長期タスクの信頼性向上を目指します。

続きを読む
CCTest · Blog
CyberFactory、実在の脆弱性を検証可能なAIエージェント訓練課題へ
AIエージェント
cctest.ai
AIエージェント

CyberFactory、実在の脆弱性を検証可能なAIエージェント訓練課題へ

CyberFactoryは、公開された脆弱性情報を実行可能な課題へ再構成し、ツール操作と実行結果によってエージェントの軌跡を検証するオープンソースの訓練基盤です。ここから訓練されたOpenAegisは、報告されたCyberGym評価で58.1%のPass@1を達成しました。

続きを読む
CCTest · Blog
SecOPD、トークン単位の蒸留で適応型プロンプトインジェクションに対抗
AIセーフティ
cctest.ai
AIセーフティ

SecOPD、トークン単位の蒸留で適応型プロンプトインジェクションに対抗

SecOPDは、応答全体ではなくトークン単位で安全性のフィードバックを与える防御的ファインチューニング手法です。論文では、Qwen3.6-27BのPISmithに対する攻撃成功率を94.0%から9.0%に下げたと報告しています。

続きを読む
CCTest · Blog
LAION-BVD、マルチモーダル学習向けに1000万時間の公開動画を提供
マルチモーダル
cctest.ai
マルチモーダル

LAION-BVD、マルチモーダル学習向けに1000万時間の公開動画を提供

LAION-BVDは、ウェブから収集した動画URLを基に、約8000万本、総計1000万時間の動画をまとめた公開データセットです。シーン分割、合成キャプション、場面転換フレームの抽出により、動画・音声・画像の事前学習を支援します。

続きを読む
CCTest · Blog
「見る」から「行動する」へ:一人称知能プラットフォームとしてのスマートグラス
マルチモーダル
cctest.ai
マルチモーダル

「見る」から「行動する」へ:一人称知能プラットフォームとしてのスマートグラス

新たなサーベイは、スマートグラスを単なるカメラやディスプレイではなく、一人称知能の基盤として捉え直す。重要なのは、知覚から行動までのループを、現実の制約下で信頼性と制御可能性を保ちながら維持できるかどうかだ。

続きを読む
CCTest · Blog
中央指揮なしで数学を探究するAIエージェント群
AI科学研究
cctest.ai
AI科学研究

中央指揮なしで数学を探究するAIエージェント群

Stationは、異なるモデル系統のAIエージェントが、固定された手順や中央コーディネーターなしで数学研究を進めるオープンワールド環境です。論文は複数の構成問題で既存文献に対して新しい結果を報告し、対話記録や証明、検証コードも公開しています。

続きを読む
CCTest · Blog
ロボットAI企業Generalist、約2億ドルを追加調達し評価額30億ドルに
ビジネス・資金調達
cctest.ai

ロボットAI企業Generalist、約2億ドルを追加調達し評価額30億ドルに

ロボット向けAI基盤モデルを開発するGeneralistが、8VC主導の追加調達を経て評価額30億ドルに達したと報じられた。今回の約2億ドルは、6月に発表したシリーズBの延長で、同ラウンドの総額は約6億ドルとなる。

続きを読む
CCTest · Blog
Prime Agent:長期稼働するAIエージェントのための永続ランタイム
AIエージェント
cctest.ai
AIエージェント

Prime Agent:長期稼働するAIエージェントのための永続ランタイム

Prime Agentは、長期タスクの評価とコーディングエージェントの運用を対象とするオープンソースのハーネスです。永続REPL、軌跡をまたぐ記憶、再帰的サブエージェント、復旧機能を組み合わせ、モデルの失敗と基盤の失敗を切り分けます。

続きを読む
CCTest · Blog
MobilePA-Bench、複雑な実タスクでモバイルエージェントを評価
モデル評価
cctest.ai
モデル評価

MobilePA-Bench、複雑な実タスクでモバイルエージェントを評価

MobilePA-Benchは、画面操作だけでなく、ツール呼び出し、長期計画、メモリ、スキル、サブエージェント協調を評価するインタラクティブなベンチマークです。権限制限や実行時エラーが加わると、最先端LLMの信頼性が大きく低下することを示します。

続きを読む
CCTest · Blog
一度の成功は信頼性ではない:Thinkingboxで業務エージェントを評価する
モデル評価
cctest.ai
モデル評価

一度の成功は信頼性ではない:Thinkingboxで業務エージェントを評価する

Thinkingboxは、妥当な返答やツール呼び出しだけでなく、業務ワークフロー終了時のバックエンド状態まで検証するサンドボックスです。ベンチマークは、偶然の成功と安定した実行能力の間に大きな差があることを示します。

続きを読む
CCTest · Blog
GameXpert-Bench:ゲーム生成から本格開発までを測る
モデル評価
cctest.ai
モデル評価

GameXpert-Bench:ゲーム生成から本格開発までを測る

GameXpert-Benchは、コーディングエージェントのゲーム開発能力を、生成・バグ修正・多段階最適化の全工程で評価する。エージェントは遊べる土台の構築には強い一方、能動的な不具合発見や実行時検証、回帰の防止には課題を残す。

続きを読む
CCTest · Blog
検索性能が上がるほど頑健性が下がる:マルチホップRAGとASR誤り
RAG・検索
cctest.ai
RAG・検索

検索性能が上がるほど頑健性が下がる:マルチホップRAGとASR誤り

音声によるマルチホップ質問応答では、より高度な検索構造が絶対的な性能を高める一方、上流の音声認識誤りを増幅する可能性がある。特に、質問中のエンティティの誤認識が大きな失敗要因となっている。

続きを読む
CCTest · Blog
TileMix、ハードウェアタイル単位でLLM注意機構の精度を切り替え
推論・デプロイ
cctest.ai
推論・デプロイ

TileMix、ハードウェアタイル単位でLLM注意機構の精度を切り替え

TileMixは、融合された密な注意機構カーネルの中で、スコアタイルごとにFP16とINT8を使い分けます。トークン間の接続を削らず、長文脈プリフィルの精度とスループットの両立を目指します。

続きを読む
CCTest · Blog
RAGのインデックス拡張で回答が変わる理由
モデル評価
cctest.ai
モデル評価

RAGのインデックス拡張で回答が変わる理由

モデルやプロンプト、検索設定を固定しても、検索インデックスを拡張すると同じ質問への回答が変わる可能性がある。新しい研究は、通常の生成揺らぎとインデックス更新による変化を分離する「スナップショット互換性監査」を提案した。

続きを読む
CCTest · Blog
RIBOSPAN、全長RNAを扱うネイティブ長文脈モデルを提案
AI科学研究
cctest.ai
AI科学研究

RIBOSPAN、全長RNAを扱うネイティブ長文脈モデルを提案

RIBOSPANは、最大10,240ヌクレオチドの文脈で事前学習した16.1億パラメータの双方向RNA基盤モデルです。短い文脈のモデルを推論時に拡張する方法と比べ、全長転写産物の表現学習で有利な特性が示されました。

続きを読む
CCTest · Blog
WorldToken、時間を軸にロボット模倣学習を組み立てる
ロボティクス・フィジカルAI
cctest.ai

WorldToken、時間を軸にロボット模倣学習を組み立てる

WorldTokenは、各時刻のマルチビュー画像、固有感覚、タスク条件を1つのワールドトークンに統合し、時間方向の系列として処理する手法です。実験では、対象領域のデータ量と長い履歴コンテキストの重要性が示されました。

続きを読む
CCTest · Blog
ReWorld、インタラクティブ世界モデルに長期記憶を実装
世界モデル
cctest.ai
世界モデル

ReWorld、インタラクティブ世界モデルに長期記憶を実装

ReWorldは、短期的な行動制御と長期的なシーン記憶を学習時に分離し、推論時には容量を制限したKVキャッシュとカメラ姿勢に基づくランドマーク検索を組み合わせます。無限に増える文脈を避けながら、再訪した場所の情報を呼び戻す設計です。

続きを読む