記事とガイド

AIエージェント

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 84 件の記事

CCTest · Blog
PolicyGuide、LLMエージェントを単一動作の監視から業務フローの誘導へ
AIエージェント
cctest.ai
AIエージェント

PolicyGuide、LLMエージェントを単一動作の監視から業務フローの誘導へ

PolicyGuideは組織のポリシーをワークフローグラフに変換し、ユーザー発話の区切りごとにエージェントの状態を検証する。危険な動作を止めるだけでなく、抜け落ちた手順を補いながら適合した経路へ導く仕組みだ。

続きを読む
CCTest · Blog
EnvHarness:静的な環境をエージェント学習に適応させる仕組み
AIエージェント
cctest.ai
AIエージェント

EnvHarness:静的な環境をエージェント学習に適応させる仕組み

EnvHarnessは、環境をゼロから作り直す代わりに、既存の静的環境をプラグインで再構成する。EnvRiggerは方策の実行軌跡を観察し、弱点に合わせた環境部品を生成して新しいロールアウトで検証する。

続きを読む
CCTest · Blog
Nvidiaの研究が示す、AIエージェントの本当の主役はモデルよりHarness
AIエージェント
cctest.ai
AIエージェント

Nvidiaの研究が示す、AIエージェントの本当の主役はモデルよりHarness

Nvidiaの研究では、モデルの周囲にあるソフトウェア層を調整するだけで、長期タスクの成績が大きく改善しました。記憶管理や監督エージェント、ツール連携がエージェント性能の中核になりつつあります。

続きを読む
CCTest · Blog
Meta、ローカル実行向け30Bエージェントモデル「Muse Glimmer」を公開
AIエージェント
cctest.ai
AIエージェント

Meta、ローカル実行向け30Bエージェントモデル「Muse Glimmer」を公開

Meta AI Researchが、Apache 2.0で提供するオープンウェイトモデル「Muse Glimmer」を発表しました。視覚入力、コーディング、多段階のツール利用、障害からの復旧をローカル環境で実現することを狙います。

続きを読む
CCTest · Blog
OpenConnector、AIエージェント向けSaaS接続を統合するオープンソース基盤
AIエージェント
cctest.ai
AIエージェント

OpenConnector、AIエージェント向けSaaS接続を統合するオープンソース基盤

OpenConnectorは、AIエージェントとアプリ開発者向けのオープンソース接続ゲートウェイです。SaaSの認証、権限管理、API適応、実行監査を共通ランタイムにまとめることを目指します。

続きを読む
CCTest · Blog
Slack、AIエージェントと協働できる「バイブコーディング」チャンネルを導入
AIエージェント
cctest.ai
AIエージェント

Slack、AIエージェントと協働できる「バイブコーディング」チャンネルを導入

Slackが、開発タスクごとにAIコーディングエージェントとチームが協働できるSlack Codeを発表した。コード差分の確認やHTMLプレビュー、公開前のフィードバックと承認に対応する。

続きを読む
CCTest · Blog
BinanceがAIエージェント取引を開放、管理の大部分はユーザーに委ねる
AIエージェント
cctest.ai
AIエージェント

BinanceがAIエージェント取引を開放、管理の大部分はユーザーに委ねる

Binanceは、ChatGPTやClaude Code、CursorなどのAIツールを取引・決済・ブロックチェーンサービスにつなぐAgent OSを発表した。エージェントはユーザーに代わって注文できるが、具体的なリスク管理は主にユーザーが担う。

続きを読む
CCTest · Blog
ウォール街が主要AIエージェント8種を実測、Qwen Officeが首位に
AIエージェント
cctest.ai
AIエージェント

ウォール街が主要AIエージェント8種を実測、Qwen Officeが首位に

ジェフリーズのアナリストが、主要なAIエージェント8製品を5種類の実務タスクで比較し、AlibabaのQwen Officeが総合1位となった。評価はモデル性能だけでなく、実行基盤であるHarnessとタスク単価の重要性も示している。

続きを読む
CCTest · Blog
Agentic ESOpt:進化戦略で長期タスク型LLMエージェントを微調整
AIエージェント
cctest.ai
AIエージェント

Agentic ESOpt:進化戦略で長期タスク型LLMエージェントを微調整

Agentic ESOptは、長期的で分岐の多いエージェントの微調整に進化戦略を用いる手法を提案する。推論時に近いメモリ使用量でパラメータを探索し、モデルとコンテキストの同時最適化を目指す。

続きを読む
CCTest · Blog
Agent Skillsはなぜ効き、なぜ失敗するのか
AIエージェント
cctest.ai
AIエージェント

Agent Skillsはなぜ効き、なぜ失敗するのか

複数のベンチマーク、エージェント基盤、LLMを横断した研究は、Agent Skillsの主な効果が不足した知識の注入ではなく、ノイズの多い実行履歴を手順のアンカーへ変換することにあると示した。一方、スキル数の増加は検索精度を大きく低下させる。

続きを読む
CCTest · Blog
データベースのACIDをAIエージェントへ:長期タスクを支える「エージェントトランザクション」
AIエージェント
cctest.ai
AIエージェント

データベースのACIDをAIエージェントへ:長期タスクを支える「エージェントトランザクション」

新たな研究は、推論やツール利用、コード生成、ワークスペース操作を行うLLMエージェントに、データベースのACID原則を応用する「エージェントトランザクション」を提案した。関連ベンチマークでは既存エージェントを10.6%上回ったと報告している。

続きを読む
CCTest · Blog
UI-Mate、デモを参照して再計画するオープンウェイトGUIエージェント
AIエージェント
cctest.ai
AIエージェント

UI-Mate、デモを参照して再計画するオープンウェイトGUIエージェント

UI-Mateは、環境に根差した学習基盤と、コンテキスト内の操作デモから学ぶ仕組みを組み合わせたGUIエージェントです。UI-Mate-27BはOSWorld-Verifiedで77.0%を記録したと、提供された論文概要で報告されています。

続きを読む
CCTest · Blog
Ouroboros:レビュー済みコミットで自ら進化するコーディングエージェント
AIエージェント
cctest.ai
AIエージェント

Ouroboros:レビュー済みコミットで自ら進化するコーディングエージェント

Ouroboros は、ツール、プロンプト、コンテキスト構築、コア実装までを改善対象にする自己発展型のエージェント基盤だ。論文は複数のベンチマークで高い結果を報告しつつ、自己改変システムにおける安全設計の重要性を強調している。

続きを読む
CCTest · Blog
Cloudflare、AIエージェント向けクラウドブラウザ Kitesurf を発表
AIエージェント
cctest.ai
AIエージェント

Cloudflare、AIエージェント向けクラウドブラウザ Kitesurf を発表

Cloudflare は、人間ではなく AI エージェントの利用を前提にしたクラウドホスト型ブラウザ Kitesurf を発表した。一般的な自動化タスクで Chromium より少ない計算資源を使える点を訴求している。

続きを読む
CCTest · Blog
Ant GroupがAvernetをオープンソース化、マルチエージェント協調を組織化へ
AIエージェント
cctest.ai
AIエージェント

Ant GroupがAvernetをオープンソース化、マルチエージェント協調を組織化へ

Ant Groupは、マルチエージェント協調のための基盤「Avernet」をオープンソース化し、コミュニティ版を公開した。初版はエージェントの発見、合意形成、協働、ガバナンスに重点を置く。

続きを読む
CCTest · Blog
Video-DeepResearch:連続動画に対応する次世代マルチモーダル研究エージェント
AIエージェント
cctest.ai
AIエージェント

Video-DeepResearch:連続動画に対応する次世代マルチモーダル研究エージェント

Video-DeepResearch は、静止画像中心のマルチモーダルエージェントを連続動画へ拡張する提案です。視覚ツールを飛ばして検索に逃げる傾向と、内部記憶に頼る問題に正面から取り組んでいます。

続きを読む
CCTest · Blog
Skill-α:強化学習で AI Agent のスキル生成を段階的に改善
AIエージェント
cctest.ai
AIエージェント

Skill-α:強化学習で AI Agent のスキル生成を段階的に改善

Skill-α は、Agent のスキル生成を一連の編集プロセスとして扱い、各編集が下流タスクの実行を改善するかどうかで評価する。文書由来と経験由来のスキル生成の両方で、既存のヒューリスティック型・パイプライン型手法を上回った。

続きを読む