NVIDIA AVO 的 100% ARC-AGI-3 结果测量的是工具链,而不是模型
NVIDIA AVO 通过了 ARC-AGI-3 的公开集,但该基准没有隔离工具链的贡献,也没有在私有任务上测试泛化。
NVIDIA 报告称,其 Agentic Variation Operators 系统(简称 AVO)与 Claude Opus 5 配合,完成了 ARC-AGI-3 公开的 25 个环境中的全部 183 个关卡。此次运行使用了 6,624 次环境操作,并获得 100.00 的相对人类操作效率(RHAE)分数。对于这个经过配置的代理系统来说,这是一个令人印象深刻的结果。
但这不是 Claude Opus 5 单独取得的 100% 分数,不是对 AVO 贡献的受控估计,也不是该系统能够泛化到 ARC-AGI-3 私有任务的证据。NVIDIA 在报告中说明了这些边界。有用的教训更窄:在长时程代理评估中,模型选择只是一个变量,基准记录必须同时标明工具链、接口、任务集、预算和指标。
分数属于端到端系统
代理工具链是模型周围的运行层。它决定哪些观测进入上下文、哪些工具和动作可用、记忆如何跨步骤保留、如何发现失败,以及监督者何时重新指派工作。改变这一层,同一个模型可能表现得像不同的系统。
对于公开集运行,NVIDIA 表示 AVO 使用了持久记忆、监督器、工具和自己的执行循环。Claude Opus 5 接收的是精确的 64×64 文本网格形式的每次观测,而不是 VISTA 主要配置所使用的渲染后 512×512 图像。代理获得了可用操作,但没有收到每个环境的规则或目标说明。
这些细节属于结果的一部分,而不是实现琐事。文本网格改变了感知问题。持久记忆改变了模型的即时上下文填满后可以复用的内容。监督器改变了运行对停滞的响应方式。工具描述、重试策略和操作预算改变了系统可以探索的路径。
- 模型Claude Opus 5 及其推理设置
- 运行框架记忆、监督器、工具、上下文和恢复循环
- 接口与任务文本网格观测、可用操作和公开集
- 运行记录RHAE 分数、完成关卡、操作、成本和失败
- 已观测
- 已配置的端到端系统完成了公开集运行。
- 未隔离
- 模型、记忆、监督器或接口各自的因果贡献。
- 未测量
- 对 ARC-AGI-3 半私有或完全私有任务的泛化能力。
因此,从一个标题分数中减去另一个,并不能揭示“工具链的贡献”。独立报道正确地将注意力集中在工具链上,但其“没有工具链时模型得分约为 30%”的简写,把实质不同的条件压缩成了一个开关。NVIDIA 表示,较低的 ARC Prize 数字使用了不同的推理设置,以及实质不同的代理和评估方案。
RHAE 奖励完成度和高效操作
ARC-AGI-3 提供类似互动游戏的环境,却不提供说明、明确规则或明确目标。系统必须探索,推断其操作的作用,发现目标,然后完成逐步变难的关卡。该测试旨在捕捉通过互动实现的适应能力,而不是静态问题集上的答案准确率。
ARC Prize 技术报告根据系统在每个已完成关卡中采取的操作次数与首次参与人类基线的比较,定义了相对人类操作效率(RHAE)。该比率会平方,因此如果代理采取的操作次数是基线的十倍,它在该关卡只能获得 1% 的分数。后续关卡权重更高,未完成关卡会限制环境分数,最终基准分数则在各环境之间取平均。
因此,100.00 的 RHAE 分数记录的是在该公式下完整且操作高效的表现。它不意味着每次操作都与人类相同,每个内部假设都正确,运行成本低,或系统实现了“100% 通用智能”。NVIDIA 还分别报告了原始完成数和操作数,以便解释该指标,而不是单独重复它。
NVIDIA 帖子中最接近的同模型系统比较是 VISTA。两个经过配置的系统都使用 Claude Opus 5 完成了相同的 183 个公开关卡。NVIDIA 报告 AVO 使用了 6,624 次环境操作,VISTA 使用了 7,542 次,AVO 少约 12%。
| 运行或参考 | 任务集 | 观测与系统边界 | 报告结果 | 有效结论 |
|---|---|---|---|---|
| AVO 与 Claude Opus 5 | 25 个公开环境,183 个关卡 | 文本网格观测;AVO 记忆、监督器、工具和执行循环 | 100.00 RHAE;6,624 次操作 | 这个配置好的系统高效完成了公开集 |
| VISTA 与 Claude Opus 5 | 相同的 183 个公开关卡 | 不同的后端、观测表示、记忆、上下文管理和实现 | 7,542 次操作 | 在跨系统比较中,AVO 使用了更少的操作 |
| NVIDIA 引用的 ARC Prize 模型评估 | 公开集 | 相同模型家族,不同推理和评估设置 | 约 30% | 模型层面的参考不是 AVO 消融实验 |
NVIDIA 明确表示,AVO 与 VISTA 的比较不是受控消融。记忆可能减少了重复探索,但实验没有单独测量记忆。12% 的操作差异可能反映多个相互作用的变化,因此它应当推动更窄的测试,而不是推动因果主张。
完成公开集不等于私有集泛化
在这里,“公开”比“完美”更有分量。ARC Prize 将 25 个公开环境设计为对格式的易访问展示。其报告称,这些环境有意设置得更容易,强调清晰度和参与度,并不全面代表私有集中的机制。
实际留出集要大得多:55 个半私有环境用于测试外部 API 背后的模型,另有 55 个完全私有环境为竞赛保留。这些任务相对于公开演示更难,也属于分布外任务。ARC Prize 表示不会将公开集结果放入官方排行榜,因为团队可以检查或针对这些环境,而且公开表现不是衡量通往人工通用智能进展的有效指标。
NVIDIA 的报告没有声称在任一留出集上取得结果。独立范围分析得出了相同的实际结论:让任务集、指标、推理设置和运行条件与数字绑定。公开结果可以展示一个有能力的工具链,同时让泛化能力保持未测试状态。
这并不让运行变得毫无意义。用比另一个成功的配置系统更少的操作完成 183 个互动关卡,是关于系统工程的有用证据。它只是回答了与官方私有基准不同的问题。
公开结果没有隔离 AVO 的贡献
AVO 和 VISTA 都使用 Claude Opus 5 完成了相同的 183 个公开关卡,而 AVO 使用的环境操作少约 12%。这个比较具有提示性,但报告没有逐项固定记忆、监督、恢复、提示和其他所有工具链选择。因此,作为营销重点的组件不能继承整个系统的全部增益。
公开集也曾是团队可以检查的开发面。它可以展示一个有能力的端到端系统,但只有半私有和完全私有环境才能测试系统是否能迁移到调优期间可获得的任务之外。这与 HarnessRisk 分析(中文)指出的范围问题相同:模型分数不会脱离其工具链独立传播。
下一步证据应当隔离机制
最有力的后续工作,是进行受控的 AVO 消融:固定模型、推理设置、文本网格接口、公开环境和操作预算,同时分别测试记忆、监督和恢复。半私有或完全私有评估回答的是另一个问题:系统是否能迁移到设计者可以检查的任务之外。
成本和延迟也应与分数并列。长时程系统可能用更多模型调用、工具执行、监督器遍历或存储上下文换取更高的完成率。公开报告给出了环境操作数,却没有足够信息来比较所引用配置的完整服务成本。
在这些结果出现之前,应当准确描述 NVIDIA 的运行,并只为它实际展示的内容归功。AVO 与 Claude Opus 5 以 100.00 的 RHAE 分数和 6,624 次环境操作完成了 ARC-AGI-3 公开集。这说明周围的系统很重要,也提醒我们下一个严肃的基准问题不是“哪个分数更大”,而是“系统的哪一部分改变了,以及结果是否经受住了留出集?”