返回文章列表
模型评测

FM-Bench:让大模型管理足球俱乐部20年,考验长期决策能力

阅读约 3 分钟

导语

让语言模型完成一次性任务,已经不再是最难的问题。真正棘手的是:当今天的选择会影响几年后的资源、竞争格局和生存状态时,代理能否持续做出合理决策?FM-Bench(Football Management Benchmark)试图用一场长达20个游戏赛季的足球俱乐部经营实验,回答这个问题。

把“长期能力”变成可计算的测试

在FM-Bench中,模型代理需要经营一家俱乐部,使用26种工具完成约340至400个决策节点。它们要在与对手相同的预算条件下组建阵容,进行球员交易、合同谈判、设施和青训投资,安排首发阵容,并面对可能解雇自己的董事会。每个赛季的结果都由确定性游戏引擎累积,最终形成一个总分,不依赖大模型裁判或人工评分。

测试分为两个部分。Solo赛道让15个前沿模型分别面对固定的脚本化世界;Arena则把这些模型和一个脚本代理放进同一个共享的20年环境中,直接比较它们的长期表现。研究还从总分背后提炼出六类行为能力,用于分析模型究竟是如何赢下比赛的。

结果:管理方式比规模更重要

  • 在三个随机种子下,15个模型都完成了完整的测试周期,而盲目运行的脚本基线在多数测试中提前失败。
  • claude-fable-5在Solo平均分和Arena表现中均位居前列,但Arena的冠军会在十个模型之间轮换,说明单次胜负并不稳定。
  • 模型规模、价格和供应商都无法解释最终排序;差距往往要到长期进程后段才逐渐显现。
  • 更高分的模型通常会在接近终局时减少回报周期较长的投资,避免现金闲置,并更早开始续约。
  • 数百次被拒绝的报价并没有让模型有效学会市场隐藏价格;自主管理记忆也出现两种相反问题:内容不断堆积,或每个赛季都推翻原有计划。
  • 首次参与测试的人类表现只排在模型榜单底部,显示这类环境对持续记录和系统化决策的要求并不低。

意义与局限

FM-Bench的价值在于,它把代理评估从“能否完成一个任务”推进到“能否在反馈循环中经营多年”。在这种环境里,短期看似合理的动作可能消耗未来预算,迟来的续约可能削弱阵容稳定性,而过度保守又会让资源失去价值。因此,模型的计划维护、风险控制、时序判断和状态记忆,都会被最终结果放大。

这项工作并不意味着足球模拟可以代表所有现实世界任务。测试仍然依赖特定的游戏规则、工具接口和确定性引擎,模型在其中学到的策略未必能直接迁移到真实组织管理。但它提供了一个清晰的研究方向:评估AI代理不能只看一次回答的质量,还要观察它能否在数百次决策中保持目标一致、及时更新计划,并为多年后的后果负责。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章