AgentMercury、検証可能な業務環境を大規模に合成
導入
実際の業務を担うエージェントを訓練するには、ベンチマークの設問ごとに作られた孤立したシミュレーションだけでは不十分です。企業のワークフローは、顧客、注文、在庫、権限、決済、チケット管理など複数のサービスにまたがります。一つの操作が別のサービスの状態を変えることもあります。実行でき、結果を検証でき、しかも多様な環境を大量に用意することは、エージェント強化学習の基盤上の課題になっています。
AgentMercuryは、最初に「解くべき一問」を作るのではなく、継続的に変化する業務世界を先に構築します。
主なポイント
- タスク中心から世界中心へ。 高レベルの業務シナリオを入力し、エンティティ、サービス、ツール、状態を持つ環境を生成します。タスクは固定された唯一の目的ではなく、その世界の状態や遷移から派生します。
- サービス間の不変条件を実行可能にする。 複数サービスの関係を検査可能な制約として表現します。これにより、ツール呼び出しが応答を返したかだけでなく、業務ロジックを壊していないかも確認できます。
- 業務の広がりを意識した規模。 研究者は14業種、50カ国を対象に4,783個の実行可能な環境を構築しました。提供された素材には各環境の詳細な構成はありませんが、単一ベンチマークに限定しない設計意図は読み取れます。
- 領域外評価にも改善。 評価ベンチマークを直接狙って生成していない環境で強化学習を行った結果、Qwen3.5-4BのEnterpriseOps-GYMは12.3から15.7、AIME26は45.9から56.0に上がりました。推論、コーディング、科学計算、ツール利用にも効果があったとされますが、素材には詳細な実験表は含まれていません。
- 環境を作る能力も学習対象。 Qwen3.5-35B-A3Bを構築軌跡で微調整すると、実行可能な世界を作成する成功率が高まったと報告されています。ただし、改善幅は示されていません。
意義と課題
AgentMercuryの重要性は、エージェント訓練データの単位を変えようとしている点にあります。従来の合成では、一つのタスクに入力、ツール、正解を割り当てることが多く、数を増やしても各課題が独立しがちでした。持続的な世界を単位にすれば、同じ業務ルールの下で異なる目標、初期状態、行動経路を生成できます。これは、長期的で開放的な企業業務に近い訓練設計です。
報酬設計にも可能性があります。最終回答の正誤だけでなく、状態遷移の妥当性、サービス間制約の維持、操作後の整合性を評価できるからです。仕組みが安定して拡張できれば、企業エージェントの訓練は、問題集を解く方式から、変化する業務世界で継続的に行動する方式へ移るかもしれません。
一方、合成手順、品質管理、比較手法、計算コスト、アブレーションの詳細は、今回の素材だけでは確認できません。領域外の改善が汎用的なツール利用能力によるものかも未解明です。したがって現段階では、実業務への導入を証明した完成品ではなく、有望な環境構築の設計思想として評価するのが適切です。
コメント
ログイン状態を確認中…
コメントを読み込み中…