El benchmark del chip Jalapeño de OpenAI: qué muestran realmente las cifras
El chip de inferencia Jalapeño de OpenAI lidera sus pruebas publicadas, pero la latencia, la normalización de potencia, la disponibilidad y el ajuste a la carga de trabajo limitan la conclusión de compra.
Los primeros resultados publicados por OpenAI para su chip de inferencia Jalapeño muestran un logro real de sistemas, no un veredicto de compra. En pruebas ejecutadas por la empresa con el framework público InferenceX de SemiAnalysis, Jalapeño ofreció una mejor combinación de rendimiento por kilovatio y latencia de respuesta que los sistemas NVIDIA Blackwell seleccionados para la comparación.
Las proporciones titulares son importantes. OpenAI informa de entre 1,5 y 1,9 veces más trabajo de IA por vatio con el rendimiento máximo, y de una latencia de extremo a extremo entre 1,7 y 3,6 veces menor en GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T. Esos resultados respaldan la afirmación de que OpenAI dispone de silicio de primera generación funcional con una arquitectura de servicio competitiva.
No establecen un precio menor para el cliente, un menor consumo energético del centro de datos ni un motivo para que otra empresa sustituya su flota de aceleradores. Las gráficas cubren modelos, longitudes de secuencia, precisiones, configuraciones de software y potencias nominales del encapsulado especificados. Jalapeño no está a la venta y OpenAI espera realizar solo un despliegue inicial pequeño a finales de 2026.
Jalapeño mejoró ambos lados del equilibrio del servicio
Un servicio de inferencia rara vez maximiza una sola cifra. Añadir solicitudes simultáneas puede aumentar el rendimiento total de tokens, pero cada usuario puede esperar más. Reducir el batching puede hacer que un flujo individual parezca más rápido y dejar sin aprovechar hardware costoso. La comparación útil es por tanto una curva: ¿cuánto trabajo agregado puede completar el sistema en cada latencia aceptable?
OpenAI utilizó tres cargas de trabajo de InferenceX con secuencias fijas. El apéndice publicado las etiqueta como pruebas nominales de entrada de 8K y salida de 1K, y comunica resultados en distintos puntos de operación en lugar de en un único nivel de concurrencia elegido. GPT-OSS 120B se comparó con GB200; DeepSeek R1 y Kimi K2.5, con GB300. Las pruebas de DeepSeek y Kimi utilizaron MXFP4, un formato compacto de coma flotante de 4 bits.
En el rendimiento máximo, OpenAI comunica estas proporciones:
| Modelo probado | Sistema de comparación | Rendimiento máximo de Jalapeño por kW | Latencia de extremo a extremo de Jalapeño |
|---|---|---|---|
| GPT-OSS 120B | NVIDIA GB200 | 1,9× mayor | 1,7× menor |
| DeepSeek R1 670B | NVIDIA GB300 | 1,7× mayor | 3,6× menor |
| Kimi K2.5 1T | NVIDIA GB300 | 1,5× mayor | 3,4× menor |
Son mediciones de OpenAI, no una reproducción independiente. Aun así, el framework es más informativo que el pico bruto del chip. InferenceX define la interactividad como la tasa de tokens transmitidos por usuario, y la interactividad normalizada de extremo a extremo como los tokens de salida divididos por la latencia completa de la solicitud, incluido el tiempo hasta el primer token. Su metodología publicada también varía la longitud de secuencia, la concurrencia, el modelo, la precisión, el framework y el hardware: las condiciones necesarias para que una cifra de inferencia sea interpretable.
El resultado importa porque los tres modelos someten al sistema a formas distintas de presión. GPT-OSS 120B es más pequeño que los otros dos; DeepSeek R1 y el modelo Kimi de un billón de parámetros requieren distribuir el trabajo entre muchos aceleradores. La información de la presentación de Hot Chips dice que OpenAI probó Jalapeño con predicción de un token, mientras que las líneas base de NVIDIA utilizaron predicción de varios tokens en las comparaciones pertinentes, y que OpenAI también presentó una comparación directa más estrecha para DeepSeek. Esos detalles de configuración deben leerse junto a las proporciones.
El rendimiento por kilovatio no es la factura eléctrica
OpenAI normalizó las gráficas con la potencia térmica de diseño del encapsulado publicada para cada acelerador, o TDP: 700 vatios para Jalapeño, 1.200 vatios para GB200 y 1.400 vatios para GB300. El TDP es una especificación de diseño utilizada para planificar la potencia y la refrigeración; no es la energía que consume realmente un servicio completo durante una ejecución.
OpenAI dice que Jalapeño se mantuvo en 550 vatios o menos en las cargas probadas. Data Center Dynamics informó de forma independiente tanto de la especificación de 700 vatios como de ese límite medido en la presentación de Hot Chips. Sin embargo, la comparación utiliza la especificación publicada de 700 vatios, no el consumo observado menor. Eso es conservador para Jalapeño a nivel del encapsulado, pero deja fuera del denominador varias facturas:
- CPU anfitrionas, memoria, conmutadores, almacenamiento y conversión de potencia;
- refrigeración y otros gastos generales de las instalaciones;
- consumo en reposo cuando el volumen de solicitudes cae por debajo de la carga del benchmark;
- solicitudes fallidas o repetidas, carga del modelo y movimiento de la caché; y
- la energía y el tiempo necesarios para producir un resultado de tarea aceptado.
La distinción funciona en ambos sentidos. Una comparación basada en el TDP del encapsulado evita conceder a un acelerador el mérito de una lectura momentánea favorable mientras se utiliza una especificación para otro. También impide sostener una afirmación sobre julios medidos por token o la potencia total de las instalaciones. La documentación de InferenceX trata esas magnitudes como métricas separadas y expone tanto julios por token como cálculos de potencia personalizados cuando las ejecuciones proporcionan la telemetría necesaria.
La cifra de compra suele ser el coste total de propiedad, no los tokens por vatio del encapsulado. El precio del hardware, las redes, la memoria, la densidad del rack, la capacidad reservada, la utilización, el trabajo de software, el tiempo de inactividad y la financiación pueden pesar más que la diferencia directa de electricidad. OpenAI no ha publicado suficientes datos para calcular una ventaja de coste para el cliente, y no hay un precio de Jalapeño porque el chip está destinado a la infraestructura propia de OpenAI.
La arquitectura explica la dirección, no todas las proporciones
El servicio de modelos lingüísticos grandes tiene al menos dos fases de hardware diferentes. Durante el prefill, el sistema procesa el prompt y realiza una computación paralela considerable. Durante el decode, genera tokens paso a paso y lee repetidamente los pesos del modelo y la caché de valores clave, el estado de atención almacenado de los tokens anteriores. El decode suele estar limitado por el ancho de banda de memoria y el movimiento de datos, no solo por la aritmética.
OpenAI dice que Jalapeño co-diseña el cómputo, la memoria de alto ancho de banda, las redes, los kernels y el software a escala de rack alrededor de esas fases. El estado del modelo puede permanecer local mientras el sistema cambia los recursos activos, reduciendo las transferencias entre grupos especializados por separado. La presentación de Hot Chips describió una red local de baja latencia que une 128 aceleradores y un dominio mayor que abarca 2.048 chips.
Ese mecanismo hace plausible la dirección del benchmark: esperar menos al estado del modelo puede mejorar la latencia de respuesta y mantener una mayor parte del presupuesto de potencia haciendo trabajo útil. No aísla qué característica produjo cada mejora. No hay una ablación pública que mantenga fija la carga de trabajo mientras elimina por separado la colocación local de memoria de Jalapeño, la topología de red, las optimizaciones del compilador o los kernels específicos del modelo.
OpenAI también dice que cada familia de modelos necesita nuevos kernels y trabajo de optimización. Es normal en el software de aceleradores, pero significa que “admite tres modelos” es evidencia de portabilidad entre esas adaptaciones, no una prueba de que toda arquitectura alcance la misma frontera. El siguiente paso más sólido sería publicar recetas exactas del benchmark y trazas de potencia sin procesar para los puntos de Jalapeño, y permitir que operadores independientes repitan las ejecuciones cuando exista acceso al hardware.
Cuatro preguntas convierten la gráfica en una decisión de despliegue
Los equipos que evalúen cualquier plataforma de inferencia, no solo Jalapeño, pueden mantener la honestidad del benchmark registrando cuatro capas de evidencia.
| Capa de decisión | Registro mínimo | Por qué la proporción titular no basta |
|---|---|---|
| Carga de trabajo | Revisión exacta del modelo, precisión, longitudes de entrada y salida, mezcla de prompts, concurrencia, batching y política de decodificación especulativa | Un agente de un modelo de frontera y una respuesta corta de chatbot estresan cuellos de botella distintos. |
| Experiencia del usuario | Tiempo hasta el primer token, tiempo entre tokens, latencia de extremo a extremo y valores p50/p95/p99 con carga normal y en ráfaga | Una media puede ocultar las solicitudes lentas que determinan si un servicio parece fiable. |
| Capacidad y energía | Tokens o tareas aceptados por segundo, potencia medida del acelerador y del sistema, consumo en reposo, utilización y julios por tarea aceptada | El TDP del encapsulado no muestra la energía del rack ni el coste del trabajo fallido. |
| Economía y operaciones | Coste de adquisición o alquiler, soporte de software, disponibilidad, tasa de fallos, personal, capacidad de despliegue y coste por tarea aceptada | Un sistema rápido que no está disponible, o que requiere mucha adaptación, no puede atender la demanda actual. |
Trace el rendimiento frente a la latencia en lugar de comparar un único pico. Repita la prueba con las longitudes de contexto y los niveles de concurrencia que el servicio realmente recibe. Mida la latencia de cola, porque los pasos secuenciales de un agente acumulan valores atípicos lentos. Después calcule la energía y el coste de las salidas aceptadas, no solo de los tokens generados.
Esta es la misma disciplina necesaria para despliegues pequeños. Nuestra guía de Qwen3.8-27B en una GPU de 16 GB separa la capacidad de los pesos, la memoria de contexto, la calidad de la tarea, el rendimiento y el coste total de operación. La escala es distinta, pero el error es el mismo: un benchmark favorable al hardware puede responder correctamente a su propia pregunta mientras deja intacta la pregunta del comprador. Nuestro explicador general de evaluación de IA muestra cómo empezar por la decisión y elegir una medición que la respalde.
El despliegue, no otra proporción, es la siguiente prueba
OpenAI y Broadcom anunciaron un despliegue inicial para finales de 2026. Richard Ho, responsable de hardware de OpenAI, dio a TechCrunch un calendario más restrictivo: volúmenes muy pequeños a finales de 2026, seguidos de un despliegue más importante en 2027. OpenAI también dice que seguirá desplegando aceleradores de NVIDIA y otros socios.
Eso hace que Jalapeño sea estratégicamente importante para OpenAI sin convertirlo en una opción de compra actual para ninguna otra empresa. La siguiente evidencia decisiva es si el chip puede mantener su ventaja de latencia y eficiencia con tráfico de producción, modelos cambiantes, utilización sostenida, fallos y una pila de software madura. Las mediciones independientes reforzarían el caso; el precio y la fiabilidad del servicio mostrarían si la mejora del hardware llega a los clientes.
Por ahora, la conclusión precisa ya es útil. Jalapeño ha desplazado la frontera publicada de la inferencia para tres cargas de trabajo concretas en las condiciones de prueba de OpenAI. No ha desplazado el límite de compra, porque la disponibilidad, la energía del sistema completo, la fiabilidad operativa y el coste total siguen sin medirse o sin divulgarse.
Fuentes
- OpenAI's first Jalapeño benchmark results
- OpenAI and Broadcom Jalapeño announcement
- SemiAnalysis InferenceX benchmark methodology and metrics
- TechCrunch report on Jalapeño performance and deployment timing
- Data Center Dynamics report from the Hot Chips presentation
- ServeTheHome report from the Hot Chips presentation