記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 775 件の記事

CCTest · Blog
検索なしで文書に答えるモデルへ――IARが示す3段階の知識内在化
RAG・検索
cctest.ai
RAG・検索

検索なしで文書に答えるモデルへ――IARが示す3段階の知識内在化

固定された文書集合について、推論時に検索結果を与えず回答するための新しい後学習手法として、IARが提案された。文書知識の注入、QA行動への整合、汎用能力の回復を分離して最適化する。

続きを読む
CCTest · Blog
NARU、日本語の超長時間動画における物語と文化理解を評価
モデル評価
cctest.ai
モデル評価

NARU、日本語の超長時間動画における物語と文化理解を評価

NARUは、日本語の長時間動画を対象に、物語の展開を追跡する能力と、明示されない文化的意味を推論する能力を同時に測るベンチマークです。既存のマルチモーダルモデルには、遠く離れた出来事の統合と文化的文脈に基づく推論に課題が残されています。

続きを読む
CCTest · Blog
Chain-of-Experience:推論中に経験から改善するLLM
モデル評価
cctest.ai
モデル評価

Chain-of-Experience:推論中に経験から改善するLLM

新たな研究は、過去の試行とフィードバックを蓄積して次の回答を修正する「Chain-of-Experience(CoE)」を提案した。数学、コード、知識タスクで、自己フィードバックと環境からの信号がモデルの継続的な改善にどう寄与するかを検証している。

続きを読む
CCTest · Blog
QuoteBenchが示す、コーディングエージェントの隠れた失敗
モデル評価
cctest.ai
モデル評価

QuoteBenchが示す、コーディングエージェントの隠れた失敗

コーディングエージェントの成否は、モデルがどんなコマンドを生成したかだけでなく、その出力が実行前にどうシリアライズ、ラップ、再解析されたかにも左右されます。QuoteBenchは、単一の一致スコアでは見えない実行経路の問題を測定しました。

続きを読む
CCTest · Blog
LinkedInの「AIスロップ」ボタン、100万人以上がクリック
プロダクト・アプリ
cctest.ai

LinkedInの「AIスロップ」ボタン、100万人以上がクリック

LinkedInは、7月30日に導入した「AIスロップのように見える」というフィードバック機能が、100万人以上に利用されたと発表しました。同社は、AIスロップと分類した投稿の閲覧数が数週間前より40%減ったとも説明しています。

続きを読む
CCTest · Blog
Nvidiaの研究が示す、AIエージェントの本当の主役はモデルよりHarness
AIエージェント
cctest.ai
AIエージェント

Nvidiaの研究が示す、AIエージェントの本当の主役はモデルよりHarness

Nvidiaの研究では、モデルの周囲にあるソフトウェア層を調整するだけで、長期タスクの成績が大きく改善しました。記憶管理や監督エージェント、ツール連携がエージェント性能の中核になりつつあります。

続きを読む
CCTest · Blog
DeepSeek、V4シリーズ初の公式ビジョン実験モデルを公開
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek、V4シリーズ初の公式ビジョン実験モデルを公開

DeepSeekはAPIプラットフォームでdeepseek-v4-flash-vision-expを公開し、V4シリーズとして初めて公式に画像入力へ対応した。ツール利用やコーディングAgent関連の評価でも、複数の指標が向上している。

続きを読む
CCTest · Blog
Meta、ローカル実行向け30Bエージェントモデル「Muse Glimmer」を公開
AIエージェント
cctest.ai
AIエージェント

Meta、ローカル実行向け30Bエージェントモデル「Muse Glimmer」を公開

Meta AI Researchが、Apache 2.0で提供するオープンウェイトモデル「Muse Glimmer」を発表しました。視覚入力、コーディング、多段階のツール利用、障害からの復旧をローカル環境で実現することを狙います。

続きを読む
CCTest · Blog
積載4.2トンの自動運転軽トラック、産業物流へ進出
ロボティクス・フィジカルAI
cctest.ai

積載4.2トンの自動運転軽トラック、産業物流へ進出

九識智能と宇通が、最大積載量4.2トン、荷室容量19.32立方メートルの自動運転軽トラック「Z20」を発表した。工場や工業団地、大型物流拠点内の高頻度輸送を主な対象とする。

続きを読む
CCTest · Blog
OpenConnector、AIエージェント向けSaaS接続を統合するオープンソース基盤
AIエージェント
cctest.ai
AIエージェント

OpenConnector、AIエージェント向けSaaS接続を統合するオープンソース基盤

OpenConnectorは、AIエージェントとアプリ開発者向けのオープンソース接続ゲートウェイです。SaaSの認証、権限管理、API適応、実行監査を共通ランタイムにまとめることを目指します。

続きを読む
CCTest · Blog
MetaのAIスマートグラスは避けにくくなる――検知アプリにも限界
AIセーフティ
cctest.ai
AIセーフティ

MetaのAIスマートグラスは避けにくくなる――検知アプリにも限界

Metaのカメラ付きスマートグラスが普及するほど、周囲の人が知らないうちに撮影される懸念が強まっている。検知アプリは手がかりを提供するが、録画中かどうかまでは判定できない。

続きを読む
CCTest · Blog
Claudeのネット接続が示したAI評価環境の盲点
AIセーフティ
cctest.ai
AIセーフティ

Claudeのネット接続が示したAI評価環境の盲点

Anthropicは過去141006回の評価実行を監査し、隔離されたはずの環境からモデルが公開インターネットへ到達した3件の事例を確認した。背景には、モデル単体の異常というより、出口制御と監視、評価環境の設計不備がある。

続きを読む
CCTest · Blog
DeepSeek V4-Flashに視覚機能、マルチモーダルAgentへ前進
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek V4-Flashに視覚機能、マルチモーダルAgentへ前進

DeepSeekは、V4-Flashに視覚機能を加えた実験版「DeepSeek-V4-Flash-Vision-Exp」を公開しました。指定されたモデルIDを通じてAPIから利用でき、テキスト能力を維持したまま画像理解を強化する位置付けです。

続きを読む
CCTest · Blog
ロボットにも「GPT-3の瞬間」:数秒の実演で新しい動作を学習
ロボティクス・フィジカルAI
cctest.ai

ロボットにも「GPT-3の瞬間」:数秒の実演で新しい動作を学習

GeneralistのGEN-1.5は、大規模な物理インタラクションデータで事前学習したロボット基盤モデルです。3〜12秒の実演を見せるだけで、パラメータ更新なしに未経験タスクへ挑戦します。

続きを読む
CCTest · Blog
4DAnyone:身近な単眼動画から動的な4D人物を再構成
視覚・動画
cctest.ai
視覚・動画

4DAnyone:身近な単眼動画から動的な4D人物を再構成

4DAnyoneは、キャリブレーションされていない単眼の人物動画から、多視点間で一貫した動画を生成し、それを4D Gaussian Splattingへ変換する手法です。増え続ける参照情報と、分割された視点グループ間の不整合を、二つのコンテキスト設計で抑えます。

続きを読む
CCTest · Blog
DeepSeek Harness v0.1.0-rc.8、エージェント作業に画像入力を導入
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek Harness v0.1.0-rc.8、エージェント作業に画像入力を導入

公開ベータ開始から1週間で、DeepSeek Harnessがv0.1.0-rc.8を公開した。ネイティブ画像リクエストとテキスト・画像の混在入力に加え、サブエージェント、Windowsの永続PowerShell、デフォルトの簡易モードを追加している。

続きを読む
CCTest · Blog
AI学習データ需要が急増、Micro1の総年率売上が5億ドルに
ビジネス・資金調達
cctest.ai

AI学習データ需要が急増、Micro1の総年率売上が5億ドルに

大手AI研究所や企業による高品質な学習データの需要が、データラベリング企業の成長を押し上げている。創業から約4年のMicro1は、8カ月で総年率売上を1億ドルから5億ドルへ伸ばしたと報じられた。

続きを読む
CCTest · Blog
Bounded Agents:マルチエージェントの委任権限を制御するAPC
AIセーフティ
cctest.ai
AIセーフティ

Bounded Agents:マルチエージェントの委任権限を制御するAPC

「Bounded Agents」は、委任された権限や予算、過去の行動を追跡するAgentic Principal Chain(APC)を提案します。モデルの判断だけに依存せず、複数の正当な操作が危険な結果につながるケースを外部の認可層で抑制します。

続きを読む
CCTest · Blog
学習の痕跡を残す残差構造:言語モデルの系譜を重みから検証
モデル評価
cctest.ai
モデル評価

学習の痕跡を残す残差構造:言語モデルの系譜を重みから検証

互換性のある言語モデルのチェックポイントが、重みだけで共通の祖先を示せるかを検証する研究が発表された。残差構造に含まれる共有成分を除き、各チェックポイント固有の痕跡を比較する。

続きを読む