Argo-Bench、企業規模の業務フローでデータエージェントを評価
導入
企業のデータ業務では、自然言語をSQLに変換するだけでは十分ではない。複数のデータ領域にまたがる情報を探し、業務上の事実を再構成し、統計分析を行ったうえで、最終的に会社が取るべき行動を決める必要がある。Argo-Benchは、この一連の流れを評価するためのベンチマークだ。
SQL生成を超えた評価
従来のtext-to-SQLベンチマークは、質問に対して適切なクエリを生成できるかを主に測定してきた。しかし、企業のデータウェアハウスでは、必要な情報が多数のテーブルに分散している。クエリが実行できても、指標の定義を取り違えたり、重要なデータを見落としたりすれば、業務判断は誤る。また、既存ベンチマークでは正解データ自体に誤りがあるケースも監査で指摘されている。
Argo-Benchは、公開データ、査読済みの業界研究、規制当局への提出資料をもとに、ニューヨーク市のフードデリバリー事業をシミュレーションする。2024年の注文数は8100万件で、Oracle E-Business Suiteを参考にしたERP型ウェアハウスには235テーブル、75億行を収録する。経済的な関係、不正のパターン、マーケットプレイスのインセンティブもモデル化されている。
エージェントが見るウェアハウスには、シミュレーターの正解状態がそのまま公開されない。そのため、テーブルを探索して必要な事実を組み立てた後、行動を提出しなければならない。不正アカウントの停止、配達員へのインセンティブ予算の配分、未払い賃金の補填などが対象となり、評価はSQLの見た目ではなく、シミュレーション内で生じた結果に基づく。
主なポイント
- データ探索、統計分析、予測、不正対策など、企業の分析業務を対象にする。
- 大規模なスキーマの中から関連テーブルと項目を特定する必要がある。
- 最終的な行動の効果を採点し、単なるクエリの正確さから離れている。
- すべてのタスクに、ウェアハウスだけで解けることを示す実行可能な参照解がある。
- 14モデルのうち、最強モデルが95点以上を得たタスクは34.8%にとどまった。
意義と影響
Argo-Benchが示すのは、「データを検索できること」と「業務上の正しい判断を下せること」の差だ。モデルが正しいSQLを出しても、重要な表を漏らしたり、事業上の意味を誤解したり、施策の副作用を確認しなかったりする可能性がある。行動後の結果を評価する設計は、企業が重視する損失削減や資源配分の妥当性に近い。
今後のデータエージェントには、SQL能力だけでなく、スキーマ理解、統計的推論、計画、検証、事業結果への配慮が求められる。シミュレーションは現実の全業界やデータ品質を完全には再現しないものの、証拠の取得から行動までを一貫して実行できるかを検証する有効な枠組みになる。公開された結果は、企業向けの信頼できるデータエージェントがまだ実用上の難題であることを示している。
コメント
ログイン状態を確認中…
コメントを読み込み中…