記事一覧へ戻る
AIエージェント

JIT-Agent、タスクごとにエージェントの実行基盤を即時生成

読了目安 3 分

導入

エージェントの性能を語るとき、多くの場合は基盤となる大規模言語モデルの規模や推論能力に焦点が当たる。しかし、同じモデルでも、記憶をどのように管理するか、目標をどう分解するか、いつどのように行動するか、外部ツールをどう組み合わせるかによって結果は大きく変わり得る。JIT-Agentは、このモデル周辺の実行設計を独立した研究対象として扱う。

論文ではこの層を「agent harness」と呼ぶ。日本語では、エージェントを動かす実行基盤や制御枠組みと考えると分かりやすい。従来のharnessは、エンジニアが個別タスク向けに手作業で設計することが多く、別のモデルや用途へそのまま移植するのは難しかった。JIT-Agentは、タスクの開始時に適切なharnessを生成する「harness intelligence model」として提案されている。

主なポイント

  • 生成可能な構造として定式化。 記憶管理、計画、行動プロトコル、ツールまたはスキルのオーケストレーションという四つのモジュールでharnessを表現する。これにより、固定されたプロンプトの集合ではなく、機械が生成・合成・変更できる対象になる。
  • タスクへの即時適応。 すべての用途に同じワークフローを適用するのではなく、目の前の課題に合わせて実行方法を調整する。論文の主張では、既存のさまざまなエージェント型LLMを支援できる。
  • 修復と自己進化。 実行が不安定になった場合はharnessを修正し、過去の設定とその性能から得られた信号を蓄積する。成功例を次の生成に反映することで、harnessの設計知識を増やしていく。
  • 複数モデルで改善を報告。 概要によれば、JIT-Agentを組み合わせたDeepSeek-V4-FlashはDeepSearchQAで9.1ポイント、OdysseyBenchで4.3ポイント、GPT-5.6を上回ったとされる。GLM-5.2では最大20.2ポイントの向上が報告され、OpenCodeやClaude Codeなどの成熟したランタイムと競争力があるほか、DeepSeek V4、Mimo-V2.5、Qwen3.6の複数規模でも改善したという。

意義と留意点

この研究が示す方向性は、エージェントの性能向上を「より強いモデルへの交換」だけに限定しないことだ。検索、コーディング、長時間のタスクでは、適切な実行手順やツール利用の制御が大きな差を生む可能性がある。さらにharnessの設定がモデルをまたいで再利用でき、過去の成功例が蓄積されるなら、エージェント開発に累積的な改善経路が生まれる。

一方、提供された素材は論文概要とページ情報が中心で、四モジュールの実装、訓練データ、推論コスト、失敗例、比較時の予算や条件は確認できない。したがって、報告された数値を一般的な優位性と断定するには追加検証が必要だ。それでもJIT-Agentは、エージェントの実行基盤そのものを、訓練可能で移転可能な能力層として捉える明確な提案である。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
AutoSaddler、失敗軌跡からLLMエージェントの実行基盤を自動改善
AIエージェント
cctest.ai
AIエージェント

AutoSaddler、失敗軌跡からLLMエージェントの実行基盤を自動改善

AutoSaddlerは、エージェントのハーネス最適化をオフライン学習として扱う手法です。実行軌跡の診断、構造化されたパッチ生成、検証による更新選択を組み合わせ、長期タスクの信頼性向上を目指します。

続きを読む
CCTest · Blog
CyberFactory、実在の脆弱性を検証可能なAIエージェント訓練課題へ
AIエージェント
cctest.ai
AIエージェント

CyberFactory、実在の脆弱性を検証可能なAIエージェント訓練課題へ

CyberFactoryは、公開された脆弱性情報を実行可能な課題へ再構成し、ツール操作と実行結果によってエージェントの軌跡を検証するオープンソースの訓練基盤です。ここから訓練されたOpenAegisは、報告されたCyberGym評価で58.1%のPass@1を達成しました。

続きを読む