記事一覧へ戻る
AIエージェント

Nvidiaの研究が示す、AIエージェントの本当の主役はモデルよりHarness

読了目安 3 分

導入

AIの性能を語るとき、私たちはモデルの規模やベンチマーク順位に注目しがちです。しかし、長時間にわたって多くの判断を連続して行うAIエージェントでは、モデルそのものだけでなく、その周囲に配置されたソフトウェア層が結果を大きく左右する可能性があります。Nvidiaの新しい研究は、この点を明確に示しました。

ここでいうHarnessとは、モデルを実際のエージェントとして動かすための仕組みです。メモリーとコンテキストを管理し、ツールやライブラリーを使わせ、フィードバックを与え、行き詰まったときのルールを定めます。モデルが判断の核だとすれば、Harnessは判断を継続的な行動へ変換する運用基盤です。

主なポイント

  • Nvidiaの研究者はClaude Opus 5向けにカスタムHarnessを作り、明確な説明のない二次元ゲームを解くARC-AGI-3で100%の成績を報告しました。
  • Harnessなしの場合、Opus 5は30%でした。それでもテスト対象モデルの中では最高でしたが、両者の差は周辺システムの重要性を示しています。
  • 研究チームは監督エージェントも追加しました。これは管理者のように主エージェントを監視し、行き止まりや無駄な探索から方向を修正します。
  • 長期タスクでは、記憶、コンテキスト処理、計画、失敗からの回復が重要です。文書編集を対象にした別の研究でも、先端モデルが連続処理の途中で多くの誤りを蓄積することが示されました。

意味と影響

1回の質問に正しく答えられるモデルが、そのまま数時間や数日にわたる仕事を安全に完了できるとは限りません。エージェントは、試した手順と失敗した経路を記憶し、適切なタイミングでツールを使い、ユーザーの目的を保ち続ける必要があります。こうした仕組みが弱ければ、強力なモデルでも途中で目的から外れ、ファイルやデータベースを損なう危険があります。

Harnessはコストにも関係します。素材で紹介されたDatabricksの研究では、同じモデルでもHarnessが異なればコストが大きく変わり得るとされています。企業は「どのモデルを使うか」だけでなく、どのような記憶方式、再試行、ツール呼び出し、監督機構を組み合わせるかを検討する必要があります。

Nvidiaが使ったAgentic Variation Operators、通称AVOは新製品ではなく、研究用に構築されたHarnessです。同社はNemoなどを通じて、エージェント基盤を組み立てるための技術要素も提供しています。今後の競争は、モデルの性能競争から、記憶と監督、実行環境、安全制御を含むシステム設計競争へ広がりそうです。

出典:TechCrunch AI

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
WEFT:ツール利用後学習を支えるシステム全体の拡張
AIエージェント
cctest.ai
AIエージェント

WEFT:ツール利用後学習を支えるシステム全体の拡張

WEFTは、汎用エージェントのツール利用学習において、実行環境だけでなくタスク、エージェント用ハーネス、評価器を一体として拡張する手法です。実行結果に基づく自己進化と、長いワークフローを安定させる学習機構を組み合わせています。

続きを読む
CCTest · Blog
VeriHarness、長期タスク向けにLLMエージェントを検証者へ
AIエージェント
cctest.ai
AIエージェント

VeriHarness、長期タスク向けにLLMエージェントを検証者へ

VeriHarnessは、テスト時に正解例や採点基準がなくても、長期タスクを処理するエージェントの成果物を検証・改善するためのフレームワークです。複数ロールアウトの不一致と一致を調べ、環境内の証拠を使って最終成果物を修正します。

続きを読む
CCTest · Blog
CacheBack、受信側が必要とするKVキャッシュだけを多エージェント間で転送
AIエージェント
cctest.ai
AIエージェント

CacheBack、受信側が必要とするKVキャッシュだけを多エージェント間で転送

CacheBackは、受信エージェントの情報要求に合わせて送信側のKVキャッシュを選別する、受信側条件付きの潜在通信手法です。FanOutQAでは、転送状態を削減しながら精度と処理遅延の改善が報告されています。

続きを読む