Waymo 的 1,000 TOPS ASIC 令人印象深刻,但不是基准测试

Waymo 披露其定制边缘 AI 计算能力超过 1,000 TOPS,但没有公布精度、功耗、利用率、内存带宽和实测延迟。

分享这篇文章

Waymo 披露,其专门设计的 5 纳米 ASIC 在传感器前端处理和机器学习模型上提供超过 1,000 TOPS——每秒一万亿次操作。这个数字听起来像基准测试结果,但它并不是。

该披露没有说明这个计数背后的数值精度、任何稀疏性假设、内存带宽、持续功率、利用率、成本或独立复现的延迟。Waymo 自己将读者引向更有用的问题:在低批量运行中,从第一个传感器输入到一次动作,完整系统能达到多少性能。

峰值 TOPS 是一个容量输入,而不是系统结果。 如果没有端到端延迟、批量行为、数据移动、能耗和散热、韧性,以及在实际达到的性能下的质量,两个拥有相同标题数字的加速器可能不适合彼此的工作负载,甚至完全无法比较。

Waymo 披露了什么,还有什么未知

在其8 月 20 日工程文章中,Waymo 表示车载计算机处理原始激光雷达、雷达和摄像头流,将定制 ML 硬件与 CPU、GPU 及其他加速器配对,并同时处理 13 个高分辨率摄像头。它描述了一套液冷系统,包含两个独立的计算引擎;这两个引擎通常运行并行工作负载,并可在发生故障后接管。

定制 ASIC 位于这条流水线的前端附近。Waymo 表示,它们处理并融合原始传感器数据,执行包括低光感知时序去噪在内的工作,并向运行传感器融合模型的专用推理引擎供给数据。措辞很重要:公司说的是**这些 ASIC(复数)**提供超过 1,000 TOPS。它没有说明有多少芯片贡献了这个数字,也没有给出单芯片数据。

Reuters 独立报道,这些定制硅片已用于 Waymo 最新一代 robotaxi 的生产,TSMC 以 5 nm 工艺制造它们。Reuters 重复了与 NVIDIA 当前自动驾驶系统的比较,但公开证据没有为该比较提供匹配的精度、工作负载、功耗或延迟条件。

Waymo 定制边缘 AI 计算公告中已知和未披露的细节

已公开披露仍未披露为什么这一差距会改变决策
定制 ASIC 提供超过 1,000 的聚合 TOPS精度、稀疏性、操作计数规则、芯片数量和利用率峰值数字无法标准化,也无法转换为实际达到的模型速度。
5 nm 工艺和传感器前端角色芯片面积、内存容量和带宽、接口、良率和成本仅凭制程节点大小无法揭示数据移动限制或系统经济性。
低批量重点和更低的像素到动作延迟工作负载、测试流程、延迟数值、分布和独立复现没有相同输入、质量目标和百分位数,延迟主张无法比较。
液冷和冗余计算引擎持续瓦数、散热限制、故障切换时间、降级容量和恢复测试峰值运行和容错运行可能具有不同的性能范围。

The Next Web 的独立评测(英文)得出了一个有用的边界:Waymo 仍将 NVIDIA 和 AMD 列为供应商,并称完整计算机是异构系统。定制硅片增加了一个专用前端;该披露不支持“一块新芯片取代车载计算机其余部分”这一更简单的说法。

  1. 峰值声称

    未披露条件下的每秒操作数

  2. 实际加速器工作量

    考虑精度、稀疏性和利用率后的有效模型工作

  3. 系统结果

    在真实延迟和功耗范围内交付正确决策

  • 延迟端到端,包括尾部百分位
  • 批量并发性和到达模式
  • 数据传感器输入和内存移动
  • 能耗持续功率和散热限制
  • 韧性降级模式和恢复
  • 质量在实际性能下的准确率
峰值 TOPS 是系统测试的输入,而不是测试结果。可辩护的边缘 AI 比较会让工作负载经过六项已测量预算,最终产生正确且及时的系统结果。

TOPS 计算的是算术,不是截止时间

一个 TOPS 意味着每秒一万亿次计数操作。这是加速器在特定条件下的属性,并不是应用产生正确结果所需的时间。

即使是粗略换算,也需要更多信息。如果一条模型路径需要 N 次计数操作,而加速器的峰值速率为 P,其理想化计算下限是 N / P。真实路径更接近:

end-to-end time = input + preprocessing + model compute + data movement
                + postprocessing + scheduling + action

model compute ≈ counted operations / (peak rate × achieved utilization)

这两行都不是对 Waymo 的预测,而是揭示 TOPS 标题数字遗漏了什么。数值精度会改变芯片能够发出的算术量。结构化稀疏性可能让硬件跳过选定的零值工作。当模型无法让所有单元保持忙碌时,利用率会下降。即使加速器很快,内存传输、传感器摄取、编排和后处理也可能占据主导。

批大小会再次改变答案。数据中心服务可以将请求分组以提高吞吐量,同时接受一些排队和单请求延迟。处理新传感器帧的车辆却不能无限等待一个有利可图的批次。JAX Scaling Book 的推理章节对 transformer 服务也作出了同样的一般区分:推理时延迟成为一等目标,而批处理和并行会重塑吞吐量。

这就是 1,000 TOPS 数字有趣但不完整的原因。它说明 Waymo 设计了相当大的专用算术能力,却没有说明车辆能以多快或多高的效率将一组传感器输入转化为一个可接受的动作。

可比较的 TOPS 需要可比较的条件

有说服力的比较需要相同的工作负载和质量阈值、数值精度和稀疏性规则、批量与并发模式、延迟边界、功耗和散热条件、运行模式以及软件栈。如果这些条件不一致,数字描述的是彼此独立的系统画像,而不是胜者和败者。

Waymo 表示,它将在 Hot Chips 讨论计算工作。截至本文 8 月 24 日 08:10(Asia/Jakarta)进行证据核查时,公开工程文章仍未解决上述对比较至关重要的规格。未来材料可能补上部分空白:精度组合、内存带宽、持续功率、达到的延迟分布、模型质量门槛或降级模式结果。

在此之前,遗漏本身就是结论。Waymo 披露了一个严肃的定制硅片项目,以及由延迟、散热和冗余塑造的系统架构,但没有发布可复现的基准测试。另一个标有 1,000 TOPS 的产品不会完成比较;两个数字背后经过测量的系统结果仍然未知。

资料来源

  1. Waymo: A look under our trunk—what’s in our compute
  2. Reuters: Waymo builds custom chip for robotaxis
  3. The Next Web: Waymo built its own robotaxi chip and published its supplier list
  4. MLCommons: A new automotive benchmark for MLPerf Inference v5.0
  5. MLCommons: MLPerf Inference Edge benchmark
  6. JAX Scaling Book: All About Transformer Inference