記事とガイド

AIエージェント

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 84 件の記事

CCTest · Blog
OpenAI、新音声モードをChatGPTデスクトップ版へ:会話からエージェント操作へ
AIエージェント
cctest.ai
AIエージェント

OpenAI、新音声モードをChatGPTデスクトップ版へ:会話からエージェント操作へ

OpenAIはChatGPTデスクトップアプリに新しいChatGPT Voiceを追加し、ユーザーが音声でChatGPT WorkやCodex、コンピューター操作機能を指示できるようにした。音声は単なる対話手段ではなく、複数ステップの作業を動かすインターフェースになりつつある。

続きを読む
CCTest · Blog
AgentDebugX:LLMエージェントの失敗を観測から修復までつなぐ
AIエージェント
cctest.ai
AIエージェント

AgentDebugX:LLMエージェントの失敗を観測から修復までつなぐ

AgentDebugX は、LLM エージェントの失敗を検出・原因特定・修復・再実行のループで扱うオープンソースフレームワークです。エラーが表面化したステップと、実際の原因ステップが異なるという問題に焦点を当てています。

続きを読む
CCTest · Blog
DataFlow-Harness:コードエージェントを編集可能なデータパイプライン構築者へ
AIエージェント
cctest.ai
AIエージェント

DataFlow-Harness:コードエージェントを編集可能なデータパイプライン構築者へ

DataFlow-Harness は、自然言語の指示と永続的なデータパイプライン成果物の間にあるギャップを埋めようとする研究です。LLM に自由なスクリプトを書かせるのではなく、プラットフォーム固有の DAG を段階的に構築させます。

続きを読む
CCTest · Blog
実行環境なしで API エージェントを学習させる新手法
AIエージェント
cctest.ai
AIエージェント

実行環境なしで API エージェントを学習させる新手法

API を呼び出すエージェントの学習には、大量の高品質な軌跡が必要です。しかし本物の環境を整備するのは重い作業です。本論文は、API 仕様だけを使って LLM に状態付き環境を模擬させる方法を提案します。

続きを読む
CCTest · Blog
交渉AIは数値ではなく「振る舞い」から秘密を漏らす
AIエージェント
cctest.ai
AIエージェント

交渉AIは数値ではなく「振る舞い」から秘密を漏らす

新しい論文は、交渉中の値を暗号化しても、譲歩の速度や提示額の軌跡、収束パターンから私的制約が推測され得ると指摘する。著者らは、性能を保ちながら推論攻撃を弱める適応的なランダム化方策を提案している。

続きを読む
CCTest · Blog
RHI:AIエージェントの「ハーネス」を自己改善する試み
AIエージェント
cctest.ai
AIエージェント

RHI:AIエージェントの「ハーネス」を自己改善する試み

Recursive Harness Self-Improvement(RHI)は、エージェントを動かす外側の足場である harness を、固定された設計ではなく改善対象として扱う。少数の反復で低い推論強度のエージェント性能を高め、推論コストも下げられる可能性を示した。

続きを読む
CCTest · Blog
Kimi K3 がモデル広場に登場:Agent 向けの大型オープンモデル
AIエージェント
cctest.ai
AIエージェント

Kimi K3 がモデル広場に登場:Agent 向けの大型オープンモデル

Kimi K3 は公開直後にモデル広場へ掲載され、注目を集めました。話題の中心は、巨大なパラメータ数だけでなく、コーディングや長時間タスク、検索、表計算、フロントエンドまで広くこなす点です。

続きを読む
CCTest · Blog
企業の AI エージェントに広がるセキュリティギャップ
AIエージェント
cctest.ai
AIエージェント

企業の AI エージェントに広がるセキュリティギャップ

VentureBeat の調査によると、AI エージェントは企業内の実システムやデータにアクセスし始めている一方で、ID 管理や隔離、権限制御は追いついていない。回答企業の過半数が、すでに事故またはニアミスを経験している。

続きを読む
CCTest · Blog
自己改善型エージェントを体系化する新しいサーベイ
AIエージェント
cctest.ai
AIエージェント

自己改善型エージェントを体系化する新しいサーベイ

arXiv の新しいサーベイは、自己改善型エージェントを経験から能力を蓄積する適応システムとして捉えている。焦点は単一の手法ではなく、モデル、プロンプト、メモリ、ツール、制御ロジックを含む全体構成にある。

続きを読む
CCTest · Blog
自律型AIエージェントのリスクをどう保険で価格付けするか
AIエージェント
cctest.ai
AIエージェント

自律型AIエージェントのリスクをどう保険で価格付けするか

arXivの論文は、Agentic AI向けの保険フレームワークを提案し、自律性、権限、ガバナンス成熟度、外部依存を引き受け・価格設定に結びつけている。AI保険を単なる損失補填ではなく、運用と規制の仕組みとして捉える点が特徴だ。

続きを読む
CCTest · Blog
Agent最適化の効果は積み上がるのか:Terminal-Bench 2.0で継続学習を検証
AIエージェント
cctest.ai
AIエージェント

Agent最適化の効果は積み上がるのか:Terminal-Bench 2.0で継続学習を検証

新しい論文は、固定ベンチマークでの一回限りの改善だけでは Agent 最適化を評価できないと指摘する。新タスクを導入した継続学習設定では、手法間の差が大きく現れた。

続きを読む
CCTest · Blog
AIエージェントが購買を担う時代、ブランド忠誠度はどう変わるのか
AIエージェント
cctest.ai
AIエージェント

AIエージェントが購買を担う時代、ブランド忠誠度はどう変わるのか

arXivの論文は、AIエージェントが購買判断を実行する時代に向けて、DVM-HALLモデルとNHAS指標を提案している。人間の好みだけでなく、信頼、委任、実行リスク、検証可能性をブランド選択の要素として扱う点が特徴だ。

続きを読む
CCTest · Blog
EMG:エージェントの自己修正をグラフ照合問題として扱う新手法
AIエージェント
cctest.ai
AIエージェント

EMG:エージェントの自己修正をグラフ照合問題として扱う新手法

arXiv 論文が提案する Experience Memory Graph は、失敗からの回復を反省プロンプトではなくグラフ照合として定式化する。テスト時の反復試行を避け、関連する修正経験を一度の実行に使う点が特徴だ。

続きを読む
CCTest · Blog
SPyCE:マルチモーダルエージェントの経験を進化するスキルへ変える
AIエージェント
cctest.ai
AIエージェント

SPyCE:マルチモーダルエージェントの経験を進化するスキルへ変える

SPyCEは、視覚推論の軌跡を再利用可能なスキルとして蒸留し、方策とスキルライブラリを訓練中に同時に改善する枠組みだ。報酬だけに還元する強化学習や、静的な記憶検索に頼る手法との差別化を狙う。

続きを読む
CCTest · Blog
AIエージェントはどう許可を求めるべきか:権限設計を整理した新たなサーベイ
AIエージェント
cctest.ai
AIエージェント

AIエージェントはどう許可を求めるべきか:権限設計を整理した新たなサーベイ

arXiv の新論文は、AIエージェント向け権限システムの提案 21 件を調査し、5 つの商用エージェントとも比較している。焦点は、製品一律の安全設定ではなく、ユーザーごとの権限管理をどう実現するかにある。

続きを読む