Google DeepMind 为何在离线版 EVE Online 中测试 AI 代理

DeepMind 正在离线环境中启动 EVE 代理研究。以下是持久世界为何需要针对记忆、规划、恢复和安全的不同测试。

分享这篇文章

Google DeepMind 和 Fenris Creations 计划在 EVE Online 的本地离线版本中测试 AI 代理。与在线游戏分离是公告中最重要的部分:它创造了一个可以重复实验、刻意改变世界并检查失败的场所,而不会让玩家或线上经济进入循环。

公告没有说明 SIMA 2 是否能在 EVE 中运行数月、管理其经济,或加入公开的 Tranquility 服务器。双方都没有发布 EVE 任务套件、代理分数、技术协议或线上部署日期。项目的价值在于它选择了这样一个评估问题:持久状态、延迟后果、不完整信息,以及许多不会在一场比赛后重置行为的参与者。

受控副本可以在长时间运行中暴露记忆、规划、适应和恢复方面的失败,同时保留一个已知的重置点。这使离线世界成为有用的研究边界,而不是代理已准备好面对在线玩家或现实世界的证据。

公告的路径从远离在线玩家开始

Google DeepMind 8 月 21 日的研究文章描述了一个分阶段计划。它从离线 EVE Online 实例开始,然后可能进入 EVE Frontier,在一个持久、开放式的世界中研究人类和代理。公司表示,只有在能力成熟后,才会考虑 EVE Online 或 EVE Vanguard。

Fenris 用更直接的运营语言说明了边界。其8 月 20 日玩家更新称,工作从本地服务器上的离线版本开始,使用模拟和历史信息。它把带有选择加入访问权限的专用服务器作为未来面向玩家测试的一种可能例子。文章没有明确数据治理:双方都没有列出使用哪些历史记录、留存规则是什么,或实验的确切控制措施。

这个项目早于两篇八月文章。PC Gamer 在五月报道了这项合作,包括计划中的离线测试台,以及对长时程规划、记忆和持续学习的关注。八月材料增加了更清晰的顺序,但仍然宣布的是研究方向,而不是结果。

这些来源共同解决了两种常见误读。“离线”不一定意味着从固定数据集中进行离线强化学习;合作双方描述的是一个运行中的本地服务器,以及历史信息。“持久世界”也不意味着研究代理已经在 EVE 的公共宇宙中自由运行。实验可以跨会话保留状态,同时与线上账户和市场隔离。

持久性改变了评估必须记住的内容

许多游戏评估会把运行压缩成干净的回合:定义好的起点、可见目标、分数和重置。评估者可以比较代理,因为每次尝试都在几乎相同的条件下开始。

EVE 有趣之处在于重要状态会超出一次遭遇。市场会变化。资源会变得稀缺。信息始终不完整。其他参与者会合作、背叛,或追求无关目标。一次选择可能让之后的任务更容易、关闭一条路径,或造成很久以后才显现的责任,而原因却在更早的行动。

持久状态改变了测量单位。如果代理消耗了大量隐藏的操作预算、依赖特权状态、忘记早先的承诺,或留下评估者直到后来才发现的损害,那么一次成功的任务不能确立长时程规划能力。严肃的运行记录必须连接动作、保留的记忆、世界状态变化、延迟结果和恢复路径。

世界状态保持持久时,证据边界如何变化
评估属性基于重置的任务持久世界测试
起始状态每次尝试都恢复带版本的快照加累积状态
目标通常明确且局部可能是部分的、相互竞争的,或后来才修订
其他参与者固定策略或有限回合可以合作、竞争或改变策略的受控代理
记忆在一个回合内有用必须跨选定边界保留,同时不能保留污染
失败即时任务未完成可能延迟发生、不断累积,或具有社会和经济影响
可复现性重放同一回合分叉相同的世界快照、事件、参与者和操作预算

持久性也可能让基准无法复现。如果每次运行都遇到不同市场、不同对手和不同隐藏事件,那么分数可能更多说明场景,而不是代理。只有在这些变化经过版本化或有意随机化,并且评估者可以重放同一分支时,测试台才有用。

SIMA 2 提供代理上下文,而不是 EVE 结果

DeepMind 将 EVE 合作与 SIMA 联系起来,即 Scalable Instructable Multiworld Agent。该系统观察游戏屏幕,遵循自然语言指令,并通过虚拟键盘和鼠标控制操作,而不是使用特定于游戏的 API。这种接口旨在让同一个代理适用于不同的 3D 世界。

SIMA 2 研究概览报告称,在加入 Gemini 推理和自生成训练数据后,它在测试游戏(包括留出环境)中的任务完成度有所改善。数字和能力描述完全来自 Google DeepMind;目前没有独立的 EVE 测试与之配套。

更重要的是,同一篇文章指出了缺口。DeepMind 表示,SIMA 2 仍然难以处理需要多步推理和目标验证的超长、复杂任务。它还表示,由于上下文窗口受到限制、需要保持低延迟控制,代理的交互记忆相对较短。精确的键盘和鼠标操作、稳健的视觉理解仍是开放问题,而且访问权限仅限于一小批研究预览用户。

因此,EVE 针对的是实验室已经承认的弱点,而不是已经展示的能力。一个有意义的后果可以跨越数周的世界,对一个很快就会丢失交互历史的代理来说,是尤其尖锐的测试。

  1. 冻结世界对离线服务器、历史输入、规则和重置点进行版本化。
  2. 运行长时任务使用隐藏事件、延迟后果和其他受控参与者。
  3. 只改变一个系统测试记忆时保持模型、工具、预算和任务不变。
  4. 审计运行测量完成率、恢复、成本、策略失败和保留状态。
离线测试可以显示
随着状态和目标变化,指定的代理配置是否仍然有用且可恢复。
它本身无法显示
对真人玩家的安全上线部署、现实世界迁移,或哪个组件导致了观测到的改进。
可复现的持久世界评估需要离线边界、受控变更和可审计的运行记录。环境属性来自 Google DeepMind 的研究概要 以及 Fenris Creations 的本地服务器说明;测试设计是 AI News 的分析。

可复现协议需要分叉、留出集和延迟检查

离线服务器为受控评估打开了大门,而协议仍未发布。一个有用的设计会把世界状态视为一等工件,并把开发任务与最终主张所使用的证据分开。

每次比较都应从不可变的服务器快照开始。记录游戏构建版本、规则、经济状态、历史输入截止点、允许的观测、接口、工具、模型标识符、提示、记忆策略和操作预算。保留干净的恢复镜像,这样失败或被污染的运行可以复现,而不会悄悄把状态带入下一次尝试。

在多个时间尺度上建立任务族。短任务可以测试感知和精确控制。会话级任务可以测试计划失败后的探索与适应。多会话任务应要求代理保留一项承诺、发现发生变化的条件,并在不捏造历史的情况下修订计划。延迟检查应考察代理是否保留了不安全指令、积累了无界资源、伤害了受控参与者,或留下了未报告的世界状态变化。

然后一次只改变一个系统边界。要测试长期记忆,就固定模型、工具、世界快照、任务、对手策略和预算,只改变记忆机制。比较无持久记忆、有界检索记忆,以及明确溯源和过期机制的处理方式。如果结论是“记忆改善了规划”,那么在同一次比较中就不能同时改变更大的上下文窗口、不同的监督者和更多的重试。

使用隐藏场景分支。开发任务可以教团队如何使用接口,而留出事件则测试代理是在适应,还是在重放已知序列。将一个起始世界分叉成跨多个随机种子的匹配分支,并在能说明难度的地方加入人类或脚本基线。一次有趣的运行是演示,而不是估计。

运行记录应报告的不只是完成情况:

  • 每个时长范围内的任务完成度和达到目标的时间;
  • 操作、模型调用、token、实际耗时,以及计算或服务成本;
  • 记忆精确率、使用过时记忆、矛盾恢复和状态增长;
  • 隐藏事件后的计划修订,以及失败动作后的恢复;
  • 合作、资源转移、策略违规,以及对受控参与者的影响;
  • 无效运行、环境缺陷、干预次数和回滚成功率;以及
  • 重复运行差异、失败类别和指向可重放证据的链接。

我们的 NVIDIA AVO 基准分析(中文)体现了同样的系统纪律:模型、工具链、接口、任务和预算会随分数一起移动。HarnessRisk 分析(中文)补充了一个警告:运行时行为只是已部署代理风险的一个阶段。

隔离降低后果,但安全仍需证据

隔离降低了探索的后果。关于代理行为、适当的历史数据使用,以及任何未来线上配置中的控制措施的证据,仍然必须分别收集。

分阶段发布决策需要同时有用性和遏制的证据。评估者应能够暂停代理、限制其动作、检查其保留的状态、恢复世界、撤销访问权限,并说明哪些人或自动化参与者受到影响。任何面向玩家的阶段都需要单独记录同意、数据、身份、审核和申诉设计;离线基准不能预先决定这些问题。

它也不能确立现实世界迁移。EVE 拥有丰富的社会和经济动态,但这些动态存在于游戏规则、接口和激励之内。成功可能揭示记忆或规划的有用机制。关于机器人、组织或社会的主张,需要在这些领域进行新的评估,而不是把类比拉伸到证据之外。

下一次发布应当是协议,而不是精彩片段集锦

当团队发布带版本的环境边界、任务套件、基线、代理配置、预算、重复结果和失败证据时,这项合作才会变得具有科学信息量。清楚说明哪些历史信息进入了测试,也会填补另一个明确缺口。

在此之前,安全的结论虽然克制,却很重要。Google DeepMind 和 Fenris 从离线 EVE Online 开始,是因为持久世界可以暴露短暂、可重置游戏所隐藏的记忆和规划失败。这个设置是更强评估的前提;公开结果仍有待公布。

资料来源

  1. Google DeepMind research outline for games and EVE Online
  2. Fenris Creations description of the offline EVE research environment
  3. Google DeepMind SIMA 2 research overview and limitations
  4. PC Gamer report on the Fenris and Google DeepMind partnership