可复现性账单:918 篇 AI 论文揭示缺失产物的成本
一项涵盖 918 篇论文的研究绘制了复现 AI 研究的成本。用其发现为代码、数据、算力和审阅者时间编制预算。
一项对 918 篇实证 AI 论文的评审发现,作者提供的实现网址中有 6.72% 为空或返回错误。这是复现尝试最早可能遇到的失败:在有人租用 GPU、获取数据或检查基准之前,论文宣传的代码入口就已经失效。
这项于 8 月 27 日发表在 Patterns 的研究把这种摩擦转换成一个涵盖五类缺失文档、范围为 1–10 的分数。它所说的“成本”是额外劳动的估计,而不是云账单;研究人员也没有执行全部 918 篇论文。最好的理解是把这个结果看成文档债务地图。
把这张地图放在ICML 2026 代理复现挑战赛旁边会更实用;在该挑战中,公开日志按主张逐项评判。一名参与者报告称,在 16 天内通过一个门槛严格的流程跑过了 147 篇论文。两个项目合在一起,展示了复现预算从哪里开始,哪些廉价检查应先于算力,以及缺少材料时何时应该停止尝试。
五类文档造就第一笔账单
Thijs Snelleman、Holger Hoos 和 Odd Erik Gundersen 从 2022 至 2024 年发表于 AAAI、IJCAI、ICLR、ICML、NeurIPS、JAIR 和 JMLR 的 1,061 篇论文开始。他们排除了 143 篇理论论文,留下 918 篇实证研究用于有效分析。
每篇论文在五个维度上获得分数:
- 实现: 当代码、伪代码、设计或实践描述不完整时,重建方法所需的工作量。
- 数据: 获取相同数据、证明可比替代数据合理,或记录新数据采集所需的工作量。
- 配置: 找回超参数、语义设置、随机种子,以及这些设置被选定时所用预算的工作量。
- 实验流程: 从可运行的方法到论文所报告的指标、基线、分析和结论之间缺失步骤的工作量。
- 专业知识: 由于文档没有提供,独立研究人员必须获得的专门知识。
研究有意把硬件要求排除在这个量表之外。因此,一个模型可能在文档方面得分很好,却仍然贵到小型实验室无法训练。反过来,一个廉价的 CPU 实验也可能得分很高,因为复现它需要猜测。“低成本”意味着通过作者材料的路径更清晰,而不是执行便宜。
在样本中,70.52% 的论文公开了实现,94.01% 使用了公开数据。损坏链接的分母比 918 篇论文这个标题数字更窄:是提供的实现网址中有 6.72% 为空或出错,而不是 6.72% 的论文。
期刊和会议的比较也是相对的。作者报告,在这个样本中,来自三个机器学习会议的论文平均复现成本比来自通用 AI 会议的论文低 16.52%,比期刊论文低 12.91%。这些百分比比较的是不同群组的序数文档分数,不能为某次具体复现定价,也不能证明其结果在重跑后会保持。
一名审阅者承担了大部分测量工作
每篇论文的主要评审都由研究的第一作者完成。14 名独立志愿者为 46 篇论文提供了第二次评审,占 918 篇论文集合的 5.01%。
在实现、数据和配置方面,评审一致性被评为优秀;实验流程为良好;专业知识为中等。这个模式很有信息量:评审者通常可以核实仓库或参数表是否存在,而估计另一位研究人员需要获得多少领域知识,则更依赖判断。
研究作者把数据和分析代码发布在有版本记录的 Zenodo 条目中,所以读者可以检查量表和计算。该存档提高了可审计性,但有限的二次评审样本仍然限制了我们解读小型期刊差异时的信心。
获奖论文的平均成本并不低于同一场所的其他论文。换句话说,声望并不是绕过产物检查的可靠捷径。
ICML 活动在 GPU 之前先付出了门槛成本
ICML 挑战赛提供了不同的证据单位。组织者收集了 2026 年会议论文的公开 Space 日志,并使用 LLM 评审者将单独主张分类为已验证、已证伪、仅由缩小规模的“玩具”实验支持,或无法确定。
AI News 在 8 月 31 日下载了最终公开的判定数据集,并统计出6,885 条经过评审的 Space 日志记录,覆盖 2,176 个独立 OpenReview 论文 ID 和 35,908 条主张判定。多份日志可以针对同一篇论文,而 LLM 判定不等同于独立的人类评审。这些数字说明了操作规模和重复尝试,而不是 6,885 个已确认的科学结果。
Nate Mauer 关于该挑战中一次活动的记录报告了 147 篇经评审论文、1,390 个计分点和 76 个满分,历时 16 天。这项工作在一台配备 20 GB GPU 的工作站上运行,另有一次租用 GPU 的微调任务除外。首轮人工运行的成本约为 52 美元;Mauer 报告,后续自动化活动中按用量计费的推理成本约为 2.69 美元。
这个引人注目的推理账单没有包含工作站、电费、工程时间和租用的训练任务。这也是参与者回顾时的内部记账,不是独立审计的价格。可迁移的发现是操作顺序。该活动在付费模型调用或长时间实验之前运行廉价门槛:
- 探测官方仓库,拒绝空的发布版本。
- 运行每个工作空间两次并比较输出,以暴露非确定性。
- 模拟评审者的阅读窗口,确保所需证据保持可见。
- 要求主张性文字中的每个数字都出现在原始结果文件中。
- 只有通过这些检查后,才花费执行和评审成本。
这一顺序并不能验证 Patterns 的期刊比较。它展示了一个操作者如何把研究中的许多文档维度转化为接收控制。
| 来源 | 单位和范围 | 测量的“成本”或结果 | 合理用途 |
|---|---|---|---|
| Patterns 研究 | 2022–2024 年来自七个场所的 918 篇实证论文 | 五个维度上的序数文档负担 | 估计缺失材料增加多少劳动;谨慎比较群组 |
| ICML 判定数据集 | 下载快照中 2,176 个论文 ID 的 6,885 条经评审 Space 日志记录 | 35,908 条主张记录的 LLM 判定 | 检查挑战吞吐量、重复尝试和主张级结果 |
| Mauer 活动报告 | 一名参与者在 16 天内评审的 147 篇论文 | 流程吞吐量、内部支出、失败和门槛设计 | 研究一种具体操作策略;不要把账单当作市场价格 |
在打开昂贵队列前编制预算
真正的复现预算需要同时包括可减少的文档劳动和不可减少的执行资源。下面的工作表在本地费率处有意留白。云价格、薪资、数据费用和可接受的不确定性差异太大,研究分数或一次挑战参与者的花费都无法提供诚实的默认值。
| 预算项目 | 执行前要记录的证据 | 估计 | 何时继续 | 何时暂停或停止 |
|---|---|---|---|---|
| 主张定义 | 确切主张、表格或图、指标、基线、容差和所需规模 | 评估者小时数 | 接受测试明确 | 无法重建目标主张或决策规则 |
| 产物访问 | 规范仓库、不可变版本、校验和、权重和发布状态 | 分诊小时数 + 访问费用 | 审阅过的产物已解决且可以固定 | 官方路径失效,重新实现又超出范围 |
| 数据与许可 | 数据集版本、划分、许可证、访问条款、转换和敏感数据控制 | 获取小时数 + 费用 | 团队可以合法获得或证明可比数据集合理 | 权限未解决,或替代方案会改变主张 |
| 环境 | 操作系统、运行时、库、驱动、容器、种子和安装步骤 | 工程小时数 | 干净环境通过确定性冒烟测试 | 设置需要未记录的补丁或无边界依赖考古 |
| 配置 | 超参数、搜索流程、种子、停止规则和原始调参预算 | 搜索小时数 + 候选运行 | 已发布设置或预先声明的搜索可以复现 | 成功依赖猜测配置,且没有封顶协议 |
| 执行 | 硬件类别、墙钟时间、GPU 或 CPU 小时数、存储、出口流量及相关能耗 | 资源小时数 × 当前费率 | 预期运行符合批准上限 | 忠实的最低规模超过资金、时间或硬件限制 |
| 评估与审阅 | 原始输出、基线重跑、统计检查、失败标签和独立评审者 | 评审小时数 + 重跑 | 结果可以从命令追溯到结论 | 评估者无法区分产物失败与主张结果 |
| 应急 | 最大修复周期、截止日期、支出上限和再次尝试所需证据 | 明确的预留 | 每次重试都会增加新的诊断信息 | 达到上限,或重试重复同一个无法解释的失败 |
所得估计足够简单,可以审计:
总预算 = 访问和数据费用 + 工程小时数 × 全负担费率 + 计算小时数 × 硬件费率 + 存储和出口流量 + 评审小时数 × 全负担费率 + 应急预留。
最重要的字段是停止条件。没有它,损坏的环境可能耗尽计算额度,缺失的许可证可能让已完成的工作无处可用,重复修复也可能悄悄把“一次复现”变成开放式研究。
死链接终止访问,但不终止科学主张
假设论文的官方仓库返回 404。正确的接收结果是引用位置的产物不可用,而不是“主张已被证伪”。团队仍然可以根据论文重新实现方法,寻找作者维护的存档,或测试更窄的假设,但每种选择都会改变证据路径和预算。
失败的重跑也需要分类。原因可能是代码漂移、数据集变化、检查点不可用、训练非确定性、评估器不匹配、规模不足,或确实与报告结果不一致。只有最后一种可能接近科学证伪,即便如此,实验条件和统计检验仍必须支持它。
这正是相邻评估工作有用的地方。基准分数取决于产生它的流程,而模型选择始于许可、可运行产物和不可变版本(中文)。复现继承了这两项义务,然后增加了把另一团队的主张足够精确地匹配起来、以得出可比结论的负担。
相对于训练预算,研究中的 6.72% 网址失败率看起来很小,但任何一个失效的官方链接都可能让整笔预算为时过早。下一个有启发性的审计是纵向审计:一年后重新访问引用的仓库,记录哪些版本和数据集仍然可解析,并测试带有清单的场所是否保留了从主张到命令再到结果的稳定路径。