ASI-Bench 发现,没有研究流程时 AI 代理举步维艰

ASI-Bench 在人类指导逐步减少时测试科学代理。它最大的分数下降揭示了构建流程的问题,而不是关于超级智能的证据。

分享这篇文章

当 ASI-Bench 移除一份详细的人工撰写研究流程后,AI 代理的平均分数几乎下降了一半。这份新预印本在 60 个计算研究项目上测试了 18 种模型与代理配置,并以逐步减少方法论指导的方式重复每个项目。

标题所强调的结果在作者的实验中确实存在,但最有用的解读很容易被忽略。平均表现从拥有完整流程时的 50.91,降到代理只收到方法名称时的 29.10。连这个名称也移除后,平均分又下降 2.48 分,降至 26.62。在这项测试中,把一个已命名的科学方法变成可执行序列,比选择该方法更大的障碍是执行序列本身。

这说明的是受控科学执行基准的结果。它不是系统发现新科学的证据,不是对人工超级智能的预测,也不是对研究生产力的独立复现测量。

同一个项目的四个版本将责任转移给代理

ASI-Bench 论文从计算项目出发,而不是孤立问题。60 项任务涵盖 11 个领域,包括物理、化学、生物、医学和生物统计学、机器人学以及电气工程。每项任务都有输入数据、可执行环境、所需工件和评分标准。

关键设计选择是固定这些要素,同时改变提示中透露的内容。基准将四种条件称为 B1 到 B4。

条件提供的人类指导留给代理的责任
B1科学背景、方法、方程和完整流程实现并执行规定的方法
B2方法和相关约束,不提供流程将命名方法转化为可执行工作流
B3目标、数据、约束和所需输出选择方法、构建工作流并验证输出
B4B3 加上事实正确但无关的信息完成 B3 工作,同时忽略干扰

一个有代表性的任务要求代理从观测到的时空数据中推断非线性动力系统。B1 提供控制方程、数值公式和求解器流程。B2 指出方程类别和合适的数值方法。B3 则让代理自行推断系统和方法。科学目标与预期工件保持不变。

这种匹配设计比比较不相关的“简单”和“困难”任务更有信息量。分数差异可以与被有意移除的信息联系起来,但它仍然反映了实验中每个模型、工具链、提示、运行时和评分者的选择。

作者报告了广泛的构建过程:超过 1,300 个候选想法、五轮审查、超过 1,500 次沙箱运行,以及对科学一致性、可复现性、泄漏、无意的捷径和评分行为的检查。这些是同一团队报告的基准开发控制措施,不是外部审计。

最大缺口出现在方法选择之前

论文的主表对 60 项任务和 18 种代理与模型配置的分数取宏平均。大多数配置运行了三次;一个 Claude Opus 5 结果只运行了一次。评估排除了外部工具访问。

指导变化作者报告的平均值差异比较最直接隔离的内容
完整流程(B1)50.91按人类指定方案执行
仅方法名称(B2)29.10−21.82构建缺失的流程
代理选择方法(B3)26.62−2.48(相对 B2)流程已缺失后的方法选择
B3 加无关事实(B4)26.99+0.36(相对 B3)对本基准干扰项的稳健性

从 50.91 到 26.62 是 24.29 分的下降,约为 B1 平均值的 48%。把全部差异描述成“方法选择缺口”是不对的。分数损失的大约九成发生在完整流程消失、但目标方法仍然可用时。

成本结果强化了这种解读。作者报告,B1 平均每项任务使用 435 万个 token,耗时 37.8 分钟。B2 是成本最高的条件,使用 691 万个 token,耗时 49.7 分钟。方法名称可以限定方向,却没有提供足够细节来实现它,于是代理需要通过搜索和重试来重建流程。

B4 也需要保持克制。它的总体平均值与 B3 基本不变,但这并不证明科学代理通常不会受到干扰。它只说明这里使用的事实正确、与任务无关的信息没有降低聚合分数。其他无关上下文、误导性证据、工具输出或文献噪声需要单独测试。

结果属于模型和工具链的组合

ASI-Bench 评估的是配置,而不是裸语言模型。工具链控制代理看到的文件、可以运行的命令、记录进度的方式,以及处理超时和错误的方式。论文报告了同一基础模型在不同工具链中的不同分数,尽管这些比较没有隔离某一项工具链功能。

报告的 B3 最强配置是采用 ultra 推理设置的 Codex 和 GPT-5.6 Sol,得分 51.60。它是 B3 中唯一得分超过 50 的评估配置。这个结果由作者报告,并不能证明该模型独立地产生了有效的新科学知识;它确立的是一个配置好的系统在该基准工件评分器上的表现。

这一点对采购和研究主张很重要。团队不能从排行榜复制模型名称,就假定使用不同的提示、工具策略、上下文策略、执行环境或预算也能获得相同结果。我们的 NVIDIA AVO 分析(中文)从交互式基准得出了相同结论:系统边界会随分数一起移动。HarnessRisk 分析(中文)又增加了 ASI-Bench 未测量的边界——当执行出错时,有能力的研究代理是否能够被控制并恢复。

计算基准不是工作中的实验室

ASI-Bench 将评估扩展到学术问答之外。其代理必须跨越多个步骤工作,创建工件,诊断失败,并满足项目特定的检查。官方仓库发布了运行器、两个固定随机种子的数据集、任务基础设施和提交结果的途径。其中一个随机种子公开了本地评分所需的参考内容;官方途径对另一个随机种子使用私有参考内容。

即便如此,该基准仍是一个设计出来的计算环境。其主要结果不包含外部工具访问,表格没有报告人类基线,而且论文是 8 月 18 日版本的一份预印本。作者构建任务、验证流程和评分系统,然后运行受评配置。目前还没有独立团队复现报告中的分数变化。

在这个环境之外的科学自主性,还会增加分数没有覆盖的问题:选择值得研究的问题,定位不完整或相互冲突的证据,协商仪器或数据访问,进行物理实验,识别实验室中未明说的约束,以及决定一个表面上的结果是否值得相信。

其他评估让范围问题变得明显。AstaBench覆盖科学工作各阶段的 2,400 多个问题,并认为工具访问、成本和代理配置是评估必须控制的混杂因素。另一项独立案例研究在两个真实计算项目上测试了八种开源研究工具链,报告了大量设置和调试工作,并称这些系统作为受监督助手比作为自主研究者更有用。两项研究都没有验证 ASI-Bench 的数字;它们共同说明,“科学代理”并不是一个稳定的单一任务类别。

独立重跑需要的不只是最终分数

公开代码使严肃的重跑成为可能,但仅凭排行榜数字无法显示收益来自模型、工具链、预算、任务暴露程度还是评分器。一个有用的证据包应保留:

  • 确切的数据集随机种子、任务和参考版本、开发访问权限以及污染审查;
  • 模型端点、模型修订版、推理设置、抽样配置和提供商日期;
  • 工具链修订版、提示、工具、沙箱边界、上下文策略、重试规则、超时和 token 预算;
  • 同一任务集上 B1 到 B4 的结果,包括重复运行、无效运行、离散程度和任务级失败类别;
  • 原始输出工件、评分器版本、评分轨迹,以及对有争议或部分结果的裁决;以及
  • 当主张将系统与科学实践而非另一个代理比较时,单独的人类或专家辅助基线。

这份记录可以让外部团队测试论文最重要的发现:在固定条件的重跑中,B1 到 B2 的急剧下降是否仍然存在。后续实验可以每次改变一个边界——例如在固定模型、任务、提示和预算的同时提供结构化规划工具——以了解流程构建的哪一部分正在失败。

这个基准的名称指向人工超级智能,但它最有力的贡献更实际。ASI-Bench 将人类的方法论指导转化为实验变量,暴露了获得完整流程与必须自己构建流程之间的巨大差距。独立重跑、任务级失败证据,以及超越自包含计算项目的比较,将决定这一结果能够延伸多远。

资料来源

  1. ASI-Bench preprint and author-reported results
  2. Official ASI-Bench repository and public runner documentation
  3. AstaBench scientific-agent evaluation preprint
  4. Independent case study of autonomous scientific research frameworks