WorldCup Arena 避免了泄漏,但其排行榜不是裁决

WorldCup Arena 在比赛结果产生前测试 LLM 预测,但评分方式会改变排名,公开档案也不包含每一次原始模型调用。

分享这篇文章

WorldCup Arena 要求六个大型语言模型在 2026 年 FIFA 世界杯每场比赛开赛前预测结果,随后将 4,494 个已锁定的预测与模型作答时尚不存在的比赛结果进行比对评分。这一时间安排赋予实验一种罕见的优势:模型不可能从训练数据中回忆起结果,也无法在比赛进行前从网络上检索到结果。

但由此产生的排行榜就没有那么决定性了。六个系统在三分类比赛结果任务上的平均准确率为 63.9%,而机械地选择固定博彩公司盘口所偏好的球队,准确率为 64.4%。仅仅改变评分聚合方式,就产生了三个不同的获胜者;而最高排名模型相对于另一领先系统的比赛得分优势,其 bootstrap 区间跨过了零点。

去除答案泄漏后,评估的其他部分仍有待审视。任务选择、检索、评分、不确定性和产物访问仍然限制着排行榜的含义。

三重锁定让每个预测都先于结果

8 月 4 日的 WorldCup Arena 预印本描述了一次持续 39 天、覆盖赛事全部 104 场比赛的运行。在每场比赛开赛前,每个系统都会收到相同的比赛信息头、固定的博彩公司让球盘口,以及两支球队的滚动档案。模型还可以使用其提供商原生的服务端网络搜索。

每个系统都要对七个单选市场作出承诺:让球、半场/全场、比赛结果、总进球数大于或小于 2.5、双方是否进球、准确比分,以及总进球数奇偶。作者还要求预测 12 个小组冠军,并完成一项赛前锦标赛池预测,涵盖冠军、决赛选手、半决赛选手、夺冠联合会和总进球数门槛。

该协议使用了三道程序锁:

  1. 快照锁只提供该场比赛开始前最新的档案版本。只有在相关比赛日期过去后,结果才会进入之后的快照。
  2. 开赛锁要求每一次模型调用在比赛开始前完成,防止启用了搜索的模型检索到实时结果。
  3. 模板锁在调用六个系统前固定提示词、市场、评分权重和让球盘口。

这些控制直接应对时间性答案泄漏。回顾性测试通常必须估计模型是否记住了已发布的答案,或者充分隐藏细节,使答案无法被重建。WorldCup Arena 选择的问题则是答案当时尚未产生的问题。

不过,“无泄漏”仍应限定在答案边界上。系统可以搜索开赛前公开可用的球队新闻、赔率、伤病信息和分析。这些信息是合法的预测证据,而不是泄漏。因此,该基准测试的是一种端到端配置,其中包含模型系列、其提供商的搜索栈、提示词和档案,以及评分规则。它并没有隔离基础模型在没有辅助时的推理能力。

博彩公司基线比冠军更重要

论文最有信息量的比较,不是第一名与第六名之间的比较,而是六系统群体与一个简单的公共共识基线之间的比较。

在 104 场比赛中,模型在主胜、平局或客胜上的平均准确率为 63.9%。始终选择基准固定让球盘口所看好的球队,准确率达到 64.4%。只有一个系统超过了这一基线,多预测对了两场。六个系统的多数投票达到 65.4%,作者称这一结果处于最佳单个结果的噪声范围内。

模型还出现了一些可识别的共同错误。它们预测的平局少于实际发生的 27 场,低估了总进球数,并将 28% 的准确比分选择集中在 2–1。尽管滚动档案到那时更加丰富,势均力敌的淘汰赛表现仍然下降。这些模式支持一个有限的结论:系统经常把不确定的比赛压缩成相同的传统足球预测。

但这些结果并不表明使用工具的 LLM 没有任何预测价值。该任务给每个系统提供了博彩公司盘口并允许实时搜索,随后评估的是一项异常短、方差很高的赛事。实践者应认可前瞻性设计,同时避免从“没有击败这一足球锚点”跳跃到“无法预测任何变化中的事件”。

五个记分板,三个赢家

WorldCup Arena 为七个市场分配不同的分值权重,然后再加入单独的小组和锦标赛池得分。这提供了一种合理的性能视角,但它不是自然界的中性事实。

作者用五种方式重新为同一批锁定预测评分。其中一个系统赢得了比赛市场视角、前半程和完整记分卡;另一个赢得了后半程;第三个在将每个比赛日归一化为 100 后取平均时获胜。每个系统至少领先 34 个比赛日中的一个,论文报告称,归一化后,比赛日内的平均差距约为整个赛事差距的十倍。

对档案的解读发生了什么变化获胜者能够支持的结论
仅比赛市场排除小组和锦标赛池问题在预先声明的比赛权重下取得最佳总分
前半程或后半程改变纳入的比赛和赛事阶段在本届赛事该部分中的表现
完整记分卡加入小组冠军和赛前锦标赛池在论文完整加权方案下取得最佳总分
按比赛日归一化的指数重新缩放后让每个比赛日拥有相同权重跨比赛日的最佳相对平均排名

研究人员没有隐藏这种敏感性;这是他们最有力的结果之一。如果排行榜在一种合理的聚合方式改变时就发生翻转,那么它应被报告为一组以任务为条件的比较,而不应被转化为对底层模型的普遍排序。

不确定性强化了同一解读。论文对 104 场比赛进行了 10,000 次 bootstrap。它报告领先系统与 GPT 之间的比赛得分差为 22 分,95% 区间为 -49 至 94。这个区间无法在这两种配置之间确定一个稳定的赢家。

该基准不衡量校准度

校准度考察声明的概率是否与观测频率相匹配。如果一个系统对许多事件都给出 70% 的概率,那么在可比情况下,一个校准良好的预测器应当有约 70% 的正确率。

WorldCup Arena 的评分输出是单选,而不是概率分布。它的准确率和加权得分可以比较选择结果,却无法揭示模型是否恰当地表达了不确定性。一个自信的 51% 选择和一个犹豫的 34% 选择最终会变成同一个分类选项。

一个名称相似的独立预印本 WorldCupArena 展示了设计上的差异。该项目根据结果概率、比分分布、球员和事件预测、比赛统计以及赛事结果评估 13 个系统。其开源实现对核心结果使用 Brier 分数和排序概率分数,同时为其他字段使用特定任务的指标。

这两项研究并不是独立复现:它们使用了不同的系统、提示词、证据条件、输出模式、指标和综合权重。把它们放在一起很有用,因为它们展示了评估问题如何决定证据。单选市场让实时运行更容易保持一致。概率预测让校准度变得可衡量。两种设计都不应借用另一项研究的结论。

公共代码不是每次原始调用的公共记录

WorldCup Arena 作者发布了大量材料。公开仓库包含档案构建、提示词组装、提供商路由、结算、评分和分析的流水线。其链接数据集包含 46 个带时间戳的快照中的 48 份球队档案、104 场比赛、球队和场地元数据,以及官方结果。论文称,对两个冻结的 JSON 文件进行确定性评分即可重新生成其总分和图表。

然而,仓库也说明,作者的预测、原始模型响应和归档提示词会保留用于审计,但有意不公开。论文称,一个公开项目网站提供逐场选项卡片和排行榜,但这并不等同于发布分析所用的原始提供商响应、请求元数据和完整预测档案。

现有产物支持两种不同程度的可复现性:

可复现性问题当前公开证据
另一团队能否检查基准输入、流水线、评分以及报告的汇总分析?基本可以,通过代码、冻结档案、比赛、结果和公开结果网站
另一团队能否核实每个原始模型响应,并从完全公开的原始预测档案重新运行精确评分?不可以;作者保留这些产物用于审计
另一团队能否使用当前提供商模型重复该协议?原则上可以,但模型版本、服务端搜索、提供商行为和实时网络内容会有所不同
另一团队能否在同一赛事上重建前瞻性条件?不可以;结果现在已经公开,因此需要一项新的赛事

最后一项限制是根本性的。世界杯结束后,对新的运行来说,这项任务不再无泄漏。协议可以复用,但其干净的前瞻性条件会转移到下一项赛事。

另一个网站 WorldCupBenchmark提供了更简单的公开比较:四个系统在开幕赛前锁定完整的赛事晋级预测,每猜对一项得一分。其方法说明称,比赛日评分仍待完成。这一公开实现印证了人们对锁定未来事件评估的兴趣,但它既没有验证 WorldCup Arena 的七市场结果,也没有复现其滚动档案协议。

下一次干净的测试需要一个新的未来

WorldCup Arena 的贡献不是一张决定性的模型排名表,而是具体展示了:当评估等待现实创造答案时,一种污染问题可以消失。

它自己的结果随后又提供了警示标签。六个系统大多追踪相同的、受博彩公司信息影响的共识;它们的排序取决于评分视角;而公开产物没有达到完整公开原始调用记录的程度。更有力的后续研究应预先注册基于概率的评分规则,发布不可变的预测凭证和原始输出,纳入简单的统计和市场基线,并在多个互不相关的未来事件中重复该协议。

这项测试无法在 2026 年世界杯上重新运行。日历已经把它的答案变成了训练数据。

资料来源

  1. WorldCup Arena prospective evaluation preprint
  2. WorldCup Arena public code and benchmark materials
  3. Independent WorldCupArena forecasting benchmark preprint
  4. WorldCupArena open-source implementation
  5. WorldCupBenchmark public scoring methodology