VeriHarness、長期タスク向けにLLMエージェントを検証者へ
導入
大規模言語モデルのエージェントが、複数の手順、ファイル、ツール、判断を含む長期タスクに取り組むようになると、成果を検証することは生成することと同じくらい難しくなります。途中の主張が一部だけ正しかったり、複数の実行結果が食い違ったり、最終成果物が整って見えても重要な要件を落としていたりするためです。VeriHarnessは、テスト時に正解例や採点ルーブリックを利用できない状況で、固定した基盤モデルの検証能力をどう高めるかを扱います。
中心となる発想:一致を正しさとみなさない
研究では、同じ課題を複数回実行するロールアウトを調べます。異なる実行結果は、相補的な正しい主張を含む一方で、互いに矛盾することもあります。論文の観察では、不一致が有用な代替案を露呈する場合があるのに対し、合意は共通の誤りを隠す可能性があります。そのためVeriHarnessは、単純な多数決を検証方法として採用しません。
代わりに、生成に使ったLLMへワークスペース、証拠を取得するツール、再利用可能な検証スキルを与え、次の仕組みを動かします。
- 不一致解決:競合する主張を特定し、ファイルやツール出力など、タスク環境から得られる証拠で確認します。
- 合意チャレンジ:複数のロールアウトに共通する主張も検証し、未対応の要件、境界条件、抜けた手順を探します。
- 証拠に基づく修正:検証結果を最良のロールアウトの選択だけでなく、最終成果物の修正にも使います。
つまり検証は、完成文を一度採点する処理ではなく、環境を調べ、候補を比較し、成果物を直すエージェント的なループになります。
結果と注意点
提供された要約によると、VeriHarnessは5つの長期ワークスペース・ベンチマークと2つのフロンティアモデルで評価され、比較したベースラインの中で最も高い選択スコアを達成しました。証拠に基づく修正を加えると、単一ロールアウトに対してGemini 3.5 Flashでは平均6.2ポイント、Claude Opus 4.8では平均6.4ポイントの向上が報告されています。また、失敗フィードバックから検証スキルを自己改善できることも示されています。
ただし、結果には検討すべき限界があります。同じモデルとプロンプトからの反復サンプルは、独立した知識の不確実性ではなく、デコードの揺らぎを表している可能性があります。さらに、生成器と同じモデル系列の検証器は、生成器の盲点を共有し、頻出する失敗を通してしまうかもしれません。今後はモデル、プロンプト、ツール経路の多様性や、対抗的な誤りに対する見逃し率を評価する必要があります。
意義
VeriHarnessの重要性は、検証をエージェントの主要能力として設計した点にあります。単にサンプル数を増やすのではなく、不一致から有用な候補を残し、見かけ上の合意を疑い、環境の証拠で成果物を修正するからです。検証スキルが失敗フィードバックから改善できるという見方は、より信頼性の高い長期タスク・エージェントを構築するための拡張可能な方向を示します。
コメント
ログイン状態を確認中…
コメントを読み込み中…