GraphForge、証拠グラフで実務エージェントの訓練タスクを構築
導入
実務を担うエージェントには、質問に答えるだけでは不十分です。複数の形式のファイルを読み、ツールを使い分け、いくつもの手順を調整し、最後に他者が確認できる成果物を提出する必要があります。しかし、この能力を訓練するデータの作成は容易ではありません。モデルにファイルを生成させる方法は、実際の業務にある複雑さや多様性を欠きやすく、実ファイルを使う方法は、タスク固有の検証基準を用意できないことがあります。
GraphForgeは、この問題をファイル間の証拠関係から解決しようとします。ファイル、タスク、評価器を別々に生成するのではなく、証拠グラフを介して一つの構造にまとめる点が特徴です。
仕組みの要点
- 職種に基づくシード:職業シナリオに結び付いたシードから始め、扱う仕事の種類を制御しながら多様性を確保します。
- 実ファイルによるワークスペース:各シードに対して、現実のファイルで構成された作業環境を組み立てます。
- 証拠グラフの構築:ファイル同士の関係をグラフに記録し、タスクの事実や要求の根拠にします。
- 追跡可能な評価基準:タスクの指示はグラフから導出され、各評価項目は検証に必要なファイルにひも付けられます。何を根拠に判定するのかが明確になります。
- 実行確認と修正:軌跡を収集する前に初期実行を行い、タスクや評価基準が元のファイルと矛盾する場合は修正エージェントが直します。
報告された結果
論文によると、GraphForgeの軌跡2,169件でQwen3.6-27Bを微調整したところ、OpenHands上のGDPValは1,445.7となり、基準より65.7向上しました。Claude Codeでは、Workspace-Bench-Liteが63.7、SpreadsheetBench IIが24.0となり、それぞれ7.7と13.7の改善が報告されています。
さらに、微調整済みモデル自身のロールアウトから、証拠に基づく評価基準で候補を選び、拒否微調整を実施しました。三つのベンチマークすべてで追加の改善が得られたとされ、ファイルに根差した基準が、評価だけでなく訓練例の選別にも使える可能性を示しています。
意義と残る課題
GraphForgeは、現実的な作業環境、実行可能な指示、検証可能な成果物、訓練データの選別という課題を一つの流れに接続します。実ファイルが複雑さを与え、証拠グラフが要求を制約し、実行確認が壊れたタスクを発見し、ファイルにリンクした基準が結果の確認方法を定義します。
一方、より多くの職種やファイル形式、長いワークフローへの一般化は、提供された情報だけでは判断できません。ファイルの権利とプライバシー、グラフ構築のコスト、自由度の高い成果物に対する自動評価の安定性も課題です。それでも、エージェント訓練ではタスク数を増やすだけでなく、作業環境、指示、検証根拠を一貫したループにすることが重要だと示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…