記事とガイド

AIエージェント

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 105 件の記事

CCTest · Blog
MaxKernel、多エージェントで TPU カーネル生成を自動化
AIエージェント
cctest.ai
AIエージェント

MaxKernel、多エージェントで TPU カーネル生成を自動化

MaxKernel は、大規模言語モデルにコンパイラからのフィードバックとハードウェアプロファイリングを組み合わせ、TPU カーネルの開発と最適化を支援する。人間協調、自律最適化、グラフベース探索の3方式を備える。

続きを読む
CCTest · Blog
Iris、SFTと強化学習の反復で検索エージェントを高度化
AIエージェント
cctest.ai
AIエージェント

Iris、SFTと強化学習の反復で検索エージェントを高度化

Iris-miniとIris-proは、ウェブのリンク構造から多段検索タスクを作り、教師あり微調整とオンライン強化学習を交互に実施する検索エージェントです。長い推論で証拠を整理するコンテキスト管理も、評価の重要な要素として扱われています。

続きを読む
CCTest · Blog
Terminal-Universe:エージェント軌跡を再利用可能なターミナル環境へ
AIエージェント
cctest.ai
AIエージェント

Terminal-Universe:エージェント軌跡を再利用可能なターミナル環境へ

Terminal-Universeは、ターミナル型コードエージェントの軌跡から実行可能なワークスペースを復元し、追加の検証可能なタスクを作る手法です。単一のデモを、元タスクの再現、複数リポジトリの作業、そして多段階の対話に利用できる環境へ変換します。

続きを読む
CCTest · Blog
ターミナルエージェントの学習を支える「環境進化」
AIエージェント
cctest.ai
AIエージェント

ターミナルエージェントの学習を支える「環境進化」

ターミナルエージェントの性能が上がると、ゼロから生成した課題は簡単になり、学習信号を十分に与えられなくなる。新しい手法は、環境の難易度を世代ごとに引き上げ、長期的な強化学習を支える。

続きを読む
CCTest · Blog
Editable Visual Design:AI生成画像を編集可能なデザインへ
AIエージェント
cctest.ai
AIエージェント

Editable Visual Design:AI生成画像を編集可能なデザインへ

Editable Visual Designは、視覚言語モデル、画像生成モデル、Coding Agentを組み合わせ、生成後も編集できる視覚成果物を作る手法を提案する。完成画像を一枚のビットマップとして出力するのではなく、生成資産とHTML/CSSを組み合わせて構造化する点が特徴だ。

続きを読む
CCTest · Blog
Open Flowがオープンソース化、AI Agent向けワークフロー自動化を実現
AIエージェント
cctest.ai
AIエージェント

Open Flowがオープンソース化、AI Agent向けワークフロー自動化を実現

OOMOL Labは、AI Agent向けのワークフロー自動化プラットフォーム「Open Flow」をオープンソース化した。可視化Workbench、CLI、自前で運用できるランタイムを備え、Agentによるノード作成やフロー実行を支援する。

続きを読む
CCTest · Blog
HarnessDev、大規模言語モデルによるエージェント基盤の構築と進化を検証
AIエージェント
cctest.ai
AIエージェント

HarnessDev、大規模言語モデルによるエージェント基盤の構築と進化を検証

HarnessDevは、エージェントの最終回答だけでなく、その性能を左右する実行基盤を評価するベンチマークです。生成された基盤はコード、検索、研究では人手設計のシステムに及ばない一方、文章作成と機械学習実験では競争力を示しました。

続きを読む
CCTest · Blog
UI-Venus-2:ベンチマークを超えるマルチモーダルGUIエージェント
AIエージェント
cctest.ai
AIエージェント

UI-Venus-2:ベンチマークを超えるマルチモーダルGUIエージェント

UI-Venus-2は、実用的なGUI自動化を妨げる環境の狭さ、脆弱なタスク設計、結果検証の不確実性に取り組む基盤システムです。モバイル、ウェブ、デスクトップを統一的な推論・行動ループで扱い、重要な操作には安全機構を組み込みます。

続きを読む
CCTest · Blog
CAST、行動批評の学習で長期ツール利用エージェントの信頼性を高める
AIエージェント
cctest.ai
AIエージェント

CAST、行動批評の学習で長期ツール利用エージェントの信頼性を高める

CASTは、タスクの成否という疎な結果を、個々の行動を検証するための批評情報へ変換する。長期的で状態を持つツール利用タスクにおいて、実行前のリスク確認を学習させることを狙う。

続きを読む
CCTest · Blog
DS-Lighting、データサイエンス・エージェントの実行基盤を明示化
AIエージェント
cctest.ai
AIエージェント

DS-Lighting、データサイエンス・エージェントの実行基盤を明示化

データサイエンス自動化の成否は、基盤モデルだけでなくタスク定義や実行状態、成果物の制約、評価方法にも左右されます。DS-Lightingは、暗黙になりがちなエージェントのハーネスを4層に分解して扱います。

続きを読む
CCTest · Blog
EvoUndo:自己進化するLLMエージェントに安全な復元性を与える
AIエージェント
cctest.ai
AIエージェント

EvoUndo:自己進化するLLMエージェントに安全な復元性を与える

LLMエージェントはプロンプトやツール、実行ハーネスを自ら変更できますが、その変更が後の状態で取り消せるとは限りません。EvoUndoは、状態の正確な特定と復元言語の表現力が、検証可能な復元性にどう影響するかを調べます。

続きを読む
CCTest · Blog
StarHarness、モデルを再学習せず企業向けエージェントを進化
AIエージェント
cctest.ai
AIエージェント

StarHarness、モデルを再学習せず企業向けエージェントを進化

StarHarnessは、モデルの重みを固定したまま、特定の企業環境に適したエージェントのharnessを探索するフレームワークだ。プロンプトだけでなく、ツール、スキル、サブエージェント、実行ループまで最適化の対象にする。

続きを読む
CCTest · Blog
AIコーディングが速くても納品が速くならない理由――小紅書Museの実践
AIエージェント
cctest.ai
AIエージェント

AIコーディングが速くても納品が速くならない理由――小紅書Museの実践

コード生成の高速化だけでは、企業の開発期間は短縮されない。小紅書のMuseは、文脈の共有、Agentの編成、実行時の制御によって、企画から本番投入までをつなごうとしている。

続きを読む
CCTest · Blog
Cisco、9万人に個人AIエージェントを展開:企業AIは実行段階へ
AIエージェント
cctest.ai
AIエージェント

Cisco、9万人に個人AIエージェントを展開:企業AIは実行段階へ

Ciscoは社内AIを、文脈を保持し、複数の業務システムを呼び出し、監督下でタスクを進める個人エージェントへ発展させようとしている。MyAgentの意義は導入人数だけでなく、エージェントを企業業務の新しい入口にしようとしている点にある。

続きを読む
CCTest · Blog
DART-SD、多ターンのツール利用をトポロジーとして学習
AIエージェント
cctest.ai
AIエージェント

DART-SD、多ターンのツール利用をトポロジーとして学習

DART-SDは、ツール呼び出しの実行経路を単一の直線ではなく、分岐して収束する「ダイヤモンド型」の状態構造として捉える。失敗した地点以降だけを蒸留することで、正しかった推論の前半を保護する。

続きを読む