記事一覧へ戻る
モデル評価

FM-Bench、AIエージェントの20年間にわたるサッカー経営を評価

読了目安 3 分

導入

言語モデルは、範囲の限定されたタスクなら安定して実行できるようになった。しかし、現在の行動が数年後の資金、戦力、競争環境に影響する状況で、判断を長く維持できるかは別の問題だ。FM-Bench(Football Management Benchmark)は、サッカークラブの20年間の経営を通じて、この長期意思決定能力を調べる。

長期経営をどう測るか

エージェントは26種類のツールを使い、ゲーム内20年、約340〜400回の意思決定ポイントを進める。同じ予算を持つライバルを相手に、選手獲得、移籍、契約交渉、施設や育成への投資、先発メンバーの設定を行う。さらに、結果が悪ければ解任される可能性のある取締役会にも対応しなければならない。各シーズンの結果は決定論的なエンジンに蓄積され、LLMによる判定や人間の採点なしで最終スコアになる。

評価は二つの形式で行われる。Soloでは15の先端モデルが、それぞれ固定されたスクリプト世界で競う。Arenaでは同じモデル群とスクリプト型エージェントが一つの共有世界に入り、20年間の直接対決を行う。研究チームは総合スコアだけでなく、その背後にある六つの行動能力も分析した。

明らかになった傾向

  • 三つのシードで、15モデルはすべて全期間を完走した。一方、盲目的に動くスクリプト基線は多くの試行で途中失敗した。
  • claude-fable-5はSoloの平均スコアとArenaで首位に立った。ただしArenaの優勝モデルは10モデルの間で入れ替わった。
  • モデル規模、価格、ベンダーは順位を予測しなかった。差がはっきりするのは長い期間の終盤だった。
  • 高得点モデルは終盤に回収の遅い投資を抑え、現金を遊ばせず、契約更新を期限よりかなり前に始める傾向があった。
  • 大量の入札を拒否されても、市場に隠された価格をうまく推定できなかった。
  • メモリ管理には、記録を際限なく増やすケースと、毎シーズン計画を書き換えるケースという、逆方向の問題が見られた。

意義と限界

FM-Benchが重要なのは、エージェント評価の焦点を単発タスクから、長期のフィードバックループへ移した点にある。一つのシーズンでは合理的に見える選択も、将来の予算を圧迫したり、戦力の継続性を損なったりする。数百回の判断を重ねる環境では、計画の維持、資源配分、タイミング、状態記憶の弱さが最終スコアに現れる。

もちろん、このシミュレーションが現実の組織経営をそのまま代表するわけではない。ルール、ツール、決定論的エンジンに依存しており、得られた戦略が別の領域へ直接移るとは限らない。それでも、AIエージェントは一回の回答だけでなく、目標を保ち、フィードバックで計画を更新し、遠い将来の結果を考慮できるかによって評価すべきだという方向性を示している。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
StartupBench、実際の業務ワークフローで汎用エージェントを評価
モデル評価
cctest.ai
モデル評価

StartupBench、実際の業務ワークフローで汎用エージェントを評価

StartupBenchは、研究者が想定した課題ではなく、市場で利用実績のあるAIスタートアップ製品のワークフローから端到端の評価課題を作成します。評価対象の最強モデルでも、完全に達成できたのは約30%にとどまりました。

続きを読む
CCTest · Blog
PTXBench、大規模言語モデルのGPUカーネル最適化を検証
モデル評価
cctest.ai
モデル評価

PTXBench、大規模言語モデルのGPUカーネル最適化を検証

PTXBenchは、コードが正しいかだけでなく、指定したPTX命令が実行されるか、そして先端ライブラリに対して実際に高速化できるかを評価する。結果は、アーキテクチャ固有命令の利用と性能向上の間に差があることを示した。

続きを読む