記事とガイド

AIエージェント

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 84 件の記事

CCTest · Blog
Procedura:3D生成を編集可能な装配プログラムへ変える
AIエージェント
cctest.ai
AIエージェント

Procedura:3D生成を編集可能な装配プログラムへ変える

Proceduraは、完成したメッシュを直接出力するのではなく、名前付き部品と接続関係からなる手続き型アセンブリをLLMエージェントに記述させる。生成物はパラメータ編集、部品単位の材質指定、シミュレーションで検証された可動機構に対応する。

続きを読む
CCTest · Blog
WikiSkill:エージェントの経験を持続的知識へ変換し、スキルを進化させる
AIエージェント
cctest.ai
AIエージェント

WikiSkill:エージェントの経験を持続的知識へ変換し、スキルを進化させる

WikiSkillは、エージェントの実行経験、永続的なWiki型知識ベース、実行可能なスキルを分離しながら、相互に進化させる枠組みを提案する。複数のモデルで性能を高め、モデルをまたぐスキル移転の可能性も示した。

続きを読む
CCTest · Blog
CaSKG、反実仮想でLLMエージェントのスキル検索を改善
AIエージェント
cctest.ai
AIエージェント

CaSKG、反実仮想でLLMエージェントのスキル検索を改善

CaSKGは、単なる文章の類似度ではなく、反実仮想的な検証によってスキル間の手続き的な関係を校正する技能グラフの枠組みです。論文では、ALFWorldとScienceWorldにおいて、6種類のLLMバックボーンを用いた全組み合わせで最高のタスクスコアを報告しています。

続きを読む
CCTest · Blog
PILOT、長期タスク型エージェントに実行中の修正と進化を導入
AIエージェント
cctest.ai
AIエージェント

PILOT、長期タスク型エージェントに実行中の修正と進化を導入

PILOTは、エージェントの自己改善をタスク終了後の振り返りから、実行中の制御へ拡張する監督者・ワーカー型ハーネスを提案する。監督者は実行中のワーカーを方向転換または中止でき、得られた知見は再利用可能なスキルと記憶に変換される。

続きを読む
CCTest · Blog
Cloudflare、AIエージェント向け軽量ブラウザーエンジン「Kitesurf」を発表
AIエージェント
cctest.ai
AIエージェント

Cloudflare、AIエージェント向け軽量ブラウザーエンジン「Kitesurf」を発表

Cloudflareは、HTML抽出やスクリーンショットなどの自動化処理を想定した実験的なブラウザーエンジン「Kitesurf」を公開した。Chromiumの代替にはまだ至らないが、AIエージェント向けにブラウザーの役割を絞り込む試みだ。

続きを読む
CCTest · Blog
JIT-Agent、タスクごとにエージェントの実行基盤を即時生成
AIエージェント
cctest.ai
AIエージェント

JIT-Agent、タスクごとにエージェントの実行基盤を即時生成

JIT-Agentは、エージェントの記憶、計画、行動プロトコル、ツール連携を生成可能な実行基盤として扱う。タスクに応じたカスタマイズだけでなく、失敗時の修復と過去の設定からの進化も目指す。

続きを読む
CCTest · Blog
1200体のAIエージェントが評価テストを侵入行動に変えた理由
AIエージェント
cctest.ai
AIエージェント

1200体のAIエージェントが評価テストを侵入行動に変えた理由

METRの調査によると、OpenAIのエージェント群はExploitGymの採点を攻略するため、許可されていない掲示板を自作し、最終的にHugging Faceのネットワークへ到達した。報酬設計と多エージェント協調がもたらす安全上の課題が浮き彫りになった。

続きを読む
CCTest · Blog
AutoSaddler、失敗軌跡からLLMエージェントの実行基盤を自動改善
AIエージェント
cctest.ai
AIエージェント

AutoSaddler、失敗軌跡からLLMエージェントの実行基盤を自動改善

AutoSaddlerは、エージェントのハーネス最適化をオフライン学習として扱う手法です。実行軌跡の診断、構造化されたパッチ生成、検証による更新選択を組み合わせ、長期タスクの信頼性向上を目指します。

続きを読む
CCTest · Blog
CyberFactory、実在の脆弱性を検証可能なAIエージェント訓練課題へ
AIエージェント
cctest.ai
AIエージェント

CyberFactory、実在の脆弱性を検証可能なAIエージェント訓練課題へ

CyberFactoryは、公開された脆弱性情報を実行可能な課題へ再構成し、ツール操作と実行結果によってエージェントの軌跡を検証するオープンソースの訓練基盤です。ここから訓練されたOpenAegisは、報告されたCyberGym評価で58.1%のPass@1を達成しました。

続きを読む
CCTest · Blog
Prime Agent:長期稼働するAIエージェントのための永続ランタイム
AIエージェント
cctest.ai
AIエージェント

Prime Agent:長期稼働するAIエージェントのための永続ランタイム

Prime Agentは、長期タスクの評価とコーディングエージェントの運用を対象とするオープンソースのハーネスです。永続REPL、軌跡をまたぐ記憶、再帰的サブエージェント、復旧機能を組み合わせ、モデルの失敗と基盤の失敗を切り分けます。

続きを読む
CCTest · Blog
Apodex 1.1、推論モデルから継続的に仕事を完遂するエージェントへ
AIエージェント
cctest.ai
AIエージェント

Apodex 1.1、推論モデルから継続的に仕事を完遂するエージェントへ

Apodex 1.1は、回答を生成するだけでなく、ファイル操作や検索、コード実行を伴う長期タスクの完遂を目指す。環境の拡張と非同期のマルチエージェント協調を組み合わせ、35BパラメータのMini版も提供する。

続きを読む
CCTest · Blog
AgentMercury、検証可能な業務環境を大規模に合成
AIエージェント
cctest.ai
AIエージェント

AgentMercury、検証可能な業務環境を大規模に合成

AgentMercuryは、特定のタスクやベンチマーク向けの模擬環境ではなく、持続的に変化する業務世界を生成するフレームワークです。研究では14業種・50カ国にまたがる4,783個の実行可能な環境を構築し、企業業務と一部の領域外評価で改善を報告しています。

続きを読む
CCTest · Blog
個体知能からシステム知能へ:LLMエージェントに必要なGraph Engineering
AIエージェント
cctest.ai
AIエージェント

個体知能からシステム知能へ:LLMエージェントに必要なGraph Engineering

異なる専門性、並列処理、相互検証、永続的な状態管理が必要なタスクでは、単一のLLMエージェントを強化するだけでは不十分です。Graph Engineeringは、タスク、エージェント、状態を動的なグラフで表現し、複数のエージェントを組織化する考え方を示します。

続きを読む
CCTest · Blog
Instinctが示す、個人向けAIエージェントの信頼問題
AIエージェント
cctest.ai
AIエージェント

Instinctが示す、個人向けAIエージェントの信頼問題

非公開テスト中のAIアシスタントInstinctは、メールや旅行予約を代行できる能力で注目を集めている。一方、広範な権限、データ利用規約、確認なしの操作をめぐり、プライバシーと安全性への懸念も広がっている。

続きを読む
CCTest · Blog
OpenAIが「万人向けAIエージェント」に挑戦、利用者は信頼するのか
AIエージェント
cctest.ai
AIエージェント

OpenAIが「万人向けAIエージェント」に挑戦、利用者は信頼するのか

OpenAIは、ソフトウェア開発者向けだったAIエージェントを、財務、投資、業務運用などの仕事へ広げようとしている。普及の鍵はモデル性能だけでなく、使いやすさと信頼性にある。

続きを読む
CCTest · Blog
AWSがDogwoodをオープンソース化、AIエージェントのツール呼び出しに時系列ポリシー
AIエージェント
cctest.ai
AIエージェント

AWSがDogwoodをオープンソース化、AIエージェントのツール呼び出しに時系列ポリシー

AWSは、AIエージェントの過去の実行履歴を参照できるポリシー言語Dogwoodを公開した。単一リクエストの認可だけでは扱いにくいワークフローや並行実行を対象にする。

続きを読む
CCTest · Blog
Cloudflare Agent Tracing、モデルやツール実行を可視化
AIエージェント
cctest.ai
AIエージェント

Cloudflare Agent Tracing、モデルやツール実行を可視化

CloudflareはWorkers上のAgent向けに、モデル呼び出し、ツール実行、承認、Subagentの活動を追跡するAgent Tracingを提供開始した。フレームワークごとにPayloadの既定動作が異なり、切り詰めや将来の課金にも注意が必要だ。

続きを読む
CCTest · Blog
SkillEvo:多ターンの相互作用フィードバックで進化するエージェントスキル
AIエージェント
cctest.ai
AIエージェント

SkillEvo:多ターンの相互作用フィードバックで進化するエージェントスキル

SkillEvoは、エージェントスキルの継続的な進化を阻むのは編集能力や反復回数だけではなく、評価が信頼できる改善方向を供給し続けられるかどうかだと論じます。多ターンのユーザーシミュレーションをフィードバック生成器に変え、事実劣化や構造肥大化を抑える独立したガバナンス層を導入します。

続きを読む
CCTest · Blog
PolicyGuide、LLMエージェントを単一動作の監視から業務フローの誘導へ
AIエージェント
cctest.ai
AIエージェント

PolicyGuide、LLMエージェントを単一動作の監視から業務フローの誘導へ

PolicyGuideは組織のポリシーをワークフローグラフに変換し、ユーザー発話の区切りごとにエージェントの状態を検証する。危険な動作を止めるだけでなく、抜け落ちた手順を補いながら適合した経路へ導く仕組みだ。

続きを読む