Los ASIC de 1.000 TOPS de Waymo impresionan, pero no son un benchmark

Waymo ha revelado más de 1.000 TOPS de computación de IA personalizada en el borde, pero no ha publicado la precisión, potencia, utilización, ancho de banda de memoria ni latencia medida.

Comparte este artículo

Waymo ha revelado que sus ASIC de 5 nanómetros diseñados específicamente para este fin ofrecen más de 1.000 TOPS —un billón de operaciones por segundo— para procesar la parte frontal de los sensores y modelos de aprendizaje automático. La cifra suena a resultado de benchmark. No lo es.

La información no identifica la precisión numérica detrás del recuento, ningún supuesto de dispersión, el ancho de banda de memoria, la potencia sostenida, la utilización, el coste ni una latencia reproducida de forma independiente. La propia Waymo dirige a los lectores hacia una pregunta más útil: qué rendimiento logra el sistema completo en operaciones con lotes pequeños, desde la primera entrada de sensor hasta una acción.

El TOPS máximo es un dato de capacidad, no un resultado del sistema. Sin latencia de extremo a extremo, comportamiento de lotes, movimiento de datos, energía y temperatura, resiliencia y calidad con el rendimiento alcanzado, dos aceleradores con el mismo titular pueden no servir para las cargas del otro, o ser imposibles de comparar.

Qué ha revelado Waymo y qué sigue sin saberse

En su artículo de ingeniería del 20 de agosto, Waymo dice que su ordenador embarcado procesa flujos brutos de lidar, radar y cámaras, combina hardware de ML personalizado con CPU, GPU y otros aceleradores y gestiona simultáneamente 13 cámaras de alta resolución. Describe un sistema refrigerado por líquido con dos motores de computación independientes que normalmente ejecutan cargas en paralelo y pueden asumir el control tras un fallo.

Los ASIC personalizados se sitúan cerca de la parte frontal de esa canalización. Waymo dice que procesan y fusionan los datos brutos de los sensores, realizan tareas como la eliminación temporal de ruido para la percepción con poca luz y alimentan un motor de inferencia diseñado específicamente que ejecuta modelos de fusión de sensores. Las palabras importan: la empresa dice que estos ASIC, en plural, ofrecen más de 1.000 TOPS. No indica cuántos chips contribuyen a la cifra ni ofrece un dato por chip.

Reuters informó de forma independiente de que el silicio personalizado está en producción en la última generación de robotaxis de Waymo y que TSMC lo fabrica con un proceso de 5 nm. Reuters repitió una comparación con los sistemas actuales de conducción autónoma de Nvidia, pero la evidencia pública no ofrece condiciones equivalentes de precisión, carga, potencia o latencia para esa comparación.

Detalles conocidos y no divulgados del anuncio de computación de IA en el borde personalizada de Waymo

Divulgado públicamenteAún no divulgadoPor qué la diferencia cambia una decisión
Más de 1.000 TOPS agregados de ASIC personalizados

Precisión, dispersión, reglas de recuento de operaciones, número de chips y utilización

La cifra máxima no puede normalizarse ni convertirse en la velocidad alcanzada por el modelo.

Proceso de 5 nm y función de la parte frontal del sensor

Tamaño del chip, capacidad y ancho de banda de memoria, interfaces, rendimiento de fabricación y coste

El tamaño del nodo por sí solo no revela los límites del movimiento de datos ni la economía del sistema.

Énfasis en lotes pequeños y menor latencia de píxel a actuación

Carga de trabajo, procedimiento de prueba, valores de latencia, distribuciones y reproducción independiente

Una afirmación de latencia no se puede comparar sin la misma entrada, objetivo de calidad y percentil.

Refrigeración líquida y motores de computación redundantes

Vatios sostenidos, límites térmicos, tiempo de conmutación por fallo, capacidad degradada y pruebas de recuperación

La operación máxima y la operación tolerante a fallos pueden tener márgenes de rendimiento diferentes.

La revisión independiente de The Next Web (en inglés) alcanza un límite útil: Waymo sigue nombrando a Nvidia y AMD entre sus proveedores y llama al ordenador completo un sistema heterogéneo. El silicio personalizado añade una parte frontal especializada; la divulgación no respalda la afirmación más sencilla de que un chip nuevo sustituye al resto del ordenador embarcado.

  1. Cifra máxima declarada

    Operaciones por segundo en condiciones no divulgadas

  2. Trabajo conseguido del acelerador

    Trabajo útil del modelo tras considerar precisión, dispersión y utilización

  3. Resultado del sistema

    Decisiones correctas entregadas dentro de los límites reales de latencia y potencia

  • LatenciaDe extremo a extremo, incluidos los percentiles de cola
  • LoteConcurrencia y patrón de llegada
  • DatosEntrada de sensores y movimiento de memoria
  • EnergíaPotencia sostenida y límites térmicos
  • ResilienciaModo degradado y recuperación
  • CalidadExactitud con el rendimiento alcanzado
El TOPS máximo es una entrada de una prueba de sistemas, no su resultado. Una comparación defendible de IA en el borde lleva la carga de trabajo por seis presupuestos medidos hasta un resultado correcto y oportuno del sistema.

TOPS cuenta aritmética, no un plazo

Un TOPS significa un billón de operaciones contabilizadas por segundo. Es una propiedad de un acelerador en condiciones específicas, no el tiempo que tarda una aplicación en producir un resultado correcto.

Incluso una conversión aproximada necesita más información. Si una ruta de modelo requiere N operaciones contabilizadas y el acelerador tiene una tasa máxima P, su suelo de cálculo idealizado es N / P. Una ruta real se parece más a:

end-to-end time = input + preprocessing + model compute + data movement
                + postprocessing + scheduling + action

model compute ≈ counted operations / (peak rate × achieved utilization)

Ninguna de las dos líneas es una predicción para Waymo. Explican qué omite un titular de TOPS. La precisión numérica cambia cuánta aritmética puede emitir un chip. La dispersión estructurada puede permitir que el hardware salte determinados trabajos con valor cero. La utilización cae cuando un modelo no puede mantener ocupadas todas las unidades. Las transferencias de memoria, la ingestión de sensores, la orquestación y el postprocesamiento pueden dominar aunque el acelerador sea rápido.

El tamaño del lote vuelve a cambiar la respuesta. Un servicio de centro de datos puede agrupar solicitudes para aumentar el rendimiento, aceptando cierta espera en cola y demora por solicitud. Un vehículo que procesa un nuevo fotograma de sensor no puede esperar indefinidamente a un lote rentable. El capítulo de inferencia de JAX Scaling Book hace la misma distinción general para servir transformers: la latencia se convierte en un objetivo de primer nivel durante la inferencia, mientras que el batching y el paralelismo remodelan el rendimiento.

Por eso la cifra de 1.000 TOPS es interesante, pero incompleta. Dice que Waymo ha diseñado una capacidad aritmética especializada considerable. No dice con qué rapidez ni eficiencia convierte el vehículo un conjunto de entradas de sensores en una acción aceptable.

Un TOPS comparable requiere condiciones comparables

Una comparación defendible necesita la misma carga de trabajo y umbral de calidad, las mismas reglas de precisión numérica y dispersión, el mismo patrón de lotes y concurrencia, el mismo límite de latencia, las mismas condiciones de potencia y refrigeración, el mismo modo operativo y la misma pila de software. Si esas condiciones no coinciden, las cifras describen perfiles de sistemas separados, no un ganador y un perdedor.

Waymo ha dicho que hablará de su trabajo de computación en Hot Chips. En la comprobación de evidencia de este artículo, el 24 de agosto a las 08:10 de Asia/Yakarta, el artículo público de ingeniería aún dejaba sin resolver las especificaciones anteriores críticas para la comparación. El material futuro podría completar algunas filas: mezcla de precisión, ancho de banda de memoria, potencia sostenida, distribuciones de latencia alcanzada, controles de calidad del modelo o resultados en modo degradado.

Hasta entonces, la omisión es en sí misma la conclusión. Waymo ha revelado un programa serio de silicio personalizado y una arquitectura de sistema moldeada por la latencia, la refrigeración y la redundancia. No ha publicado un benchmark reproducible. Otro producto con una etiqueta de 1.000 TOPS no completaría la comparación; el resultado medido del sistema detrás de cualquiera de las dos cifras sigue siendo desconocido.

Fuentes

  1. Waymo: A look under our trunk—what’s in our compute
  2. Reuters: Waymo builds custom chip for robotaxis
  3. The Next Web: Waymo built its own robotaxi chip and published its supplier list
  4. MLCommons: A new automotive benchmark for MLPerf Inference v5.0
  5. MLCommons: MLPerf Inference Edge benchmark
  6. JAX Scaling Book: All About Transformer Inference