El bajo precio por token de Grok 4.6 no lo convierte en el modelo más barato
Grok 4.6 combina un precio anunciado bajo con benchmarks publicados sólidos, pero los reintentos, las tareas fallidas, la latencia y los cargos de herramientas pueden invertir la ventaja aparente.
SpaceXAI publicó Grok 4.6 con un precio de API que parte de 2 $ por millón de tokens de entrada y 6 $ por millón de tokens de salida. Artificial Analysis situó de forma independiente la versión de alto razonamiento en su frontera de coste-rendimiento. Ninguno de esos hechos responde a la pregunta que realmente tiene un equipo de desarrollo: ¿Grok 4.6 terminará nuestro trabajo por menos dinero?
La forma fiable de decidirlo es ejecutar las mismas tareas representativas con cada candidato, aplicar una regla de aceptación de aprobado o suspenso y dividir la factura completa —incluidos los intentos fallidos y los reintentos— entre el número de resultados aceptados. El precio de los tokens es un dato de ese cálculo, no la conclusión.
La evidencia publicada no demuestra que Grok 4.6 sea universalmente más barato que GPT-5.6 Sol para programación. Grok 4.6 tiene un precio de tokens inferior en la lista, y Artificial Analysis midió una sólida eficiencia de costes en su propia suite. Pero una comparación justa necesitaría las mismas tareas de repositorio, el mismo entorno de agente, los mismos ajustes de razonamiento, herramientas, política de reintentos y evaluador para ambos modelos. Un precio más bajo puede desaparecer si un modelo escribe más tokens, falla más veces o requiere más reparación humana.
Qué dicen realmente los benchmarks de Grok 4.6
El anuncio de Grok 4.6 dice que el modelo se centra en agentes de larga duración, programación y trabajo de conocimiento. Informa de una puntuación de 61 en el Artificial Analysis Intelligence Index, la misma puntuación destacada que aparece para GPT-5.6 Sol en la comparación de SpaceXAI. Axios describió el resultado como un regreso de SpaceXAI cerca de la frontera de modelos.
El resultado compuesto oculta variaciones significativas. La propia tabla de lanzamiento de SpaceXAI informa de los siguientes resultados, con distintos propietarios de benchmarks y entornos de agentes detrás de ellos:
| Benchmark | Grok 4.6 high | GPT-5.6 Sol max | Contra qué advierte la diferencia |
|---|---|---|---|
| CursorBench 3.2 | 69.9% | 67.2% | Una distribución de tareas de estilo IDE favorece a Grok en esta tabla. |
| DeepSWE 1.1 | 65.9% | 73.0% | Otra prueba de ingeniería de software invierte el orden. |
| Terminal-Bench 3.0 | 26.0% | 34.6% | Ni el resultado compuesto ni el precio por token predicen el éxito en tareas de terminal. |
Son resultados presentados por proveedores, no una comparación controlada ejecutada para este artículo. La tarjeta del modelo Grok 4.6 identifica las versiones de los benchmarks, el esfuerzo de razonamiento y los evaluadores o entornos externos. SpaceXAI también señala que las cifras de los competidores pueden proceder de las tarjetas publicadas por sus desarrolladores o de tablas de clasificación públicas. Eso hace que la tabla sea útil para elegir pruebas, pero no la convierte por sí sola en un experimento limpio de precio y rendimiento.
Artificial Analysis ofrece una segunda perspectiva independiente. En una actualización de evidencia del 21 de agosto de 2026, su análisis de Grok 4.6 informó de una puntuación de 61 en el Intelligence Index y un coste ponderado de unos 0,84 $ por tarea del índice. Su página activa de modelo y proveedor también comunicó unos 65,8 tokens de salida por segundo y 51,53 segundos hasta el primer token a través del endpoint de SpaceXAI medido. Estas mediciones activas pueden cambiar cuando cambien los proveedores y la infraestructura.
La cifra de 0,84 $ no es el coste por tarea exitosa en tu carga de trabajo. La metodología de Artificial Analysis combina nueve evaluaciones en inglés y solo de texto, asigna un peso del 34 % a los agentes y del 24 % a la programación, y generalmente usa una puntuación pass-at-one. Su métrica de costes utiliza los recuentos de tokens comunicados por los proveedores y los pesos de los benchmarks de la suite. Es una comparación estandarizada útil, pero su mezcla de tareas, evaluador, entorno de herramientas y comportamiento de reintentos puede no coincidir con un agente de programación en producción.
El calendario completo de precios cambia la cifra destacada
La página actual del modelo de SpaceXAI lista 2 $ por millón de tokens de entrada, 0,50 $ por millón de tokens de entrada en caché y 6 $ por millón de tokens de salida para Grok 4.6. Las notas de la versión dicen que las solicitudes con más de 200.000 tokens de prompt usan tarifas superiores de 4 $, 1 $ y 12 $, respectivamente.
La guía de la API de Grok 4.6 lista una ventana de contexto de 500.000 tokens y esfuerzos de razonamiento low, medium, high y xhigh, con high como valor predeterminado. También recomienda una clave estable de caché de prompts porque una conversación enrutada a un servidor sin caché puede pagar la tarifa completa de entrada.
Antes de la integración y del tiempo del personal hay al menos seis variables de coste:
- tokens de entrada sin caché;
- tokens de entrada en caché y la tasa de aciertos observada;
- tokens de salida y tokens ocultos de razonamiento cobrados por el proveedor;
- la tarifa superior para prompts de más de 200.000 tokens;
- llamadas fallidas, respuestas rechazadas y reintentos; y
- herramientas o servicios del proveedor con cargos separados.
Registra el uso de facturación que devuelve la API. Estimar todos los proveedores con un único tokenizador puede hacer que la comparación parezca coherente y, al mismo tiempo, no coincida con la factura.
El éxito determina si importa el precio bajo
Elige entre 20 y 50 tareas extraídas del trabajo que el equipo realmente realiza. No construyas un conjunto de pruebas solo a partir de los puntos fuertes del lanzamiento de un modelo. Una evaluación pequeña de un agente de programación podría usar cuatro familias de tareas:
| Familia de tareas | Tarea fija | Control de aceptación |
|---|---|---|
| Reparación de código | Corrige un defecto sembrado en un repositorio pequeño con las mismas herramientas y límite de tiempo. | Las pruebas objetivo pasan, la suite completa no tiene regresiones y la diferencia se mantiene dentro del alcance. |
| Navegación del repositorio | Localiza el módulo responsable de un comportamiento y explica su ruta de llamadas. | Los archivos y relaciones nombrados coinciden con una respuesta de referencia verificada por un mantenedor. |
| Uso estructurado de herramientas | Consulta una API de prueba y devuelve un esquema JSON obligatorio. | Todas las llamadas de herramientas requeridas terminan y la validación del esquema pasa. |
| Trabajo de conocimiento con contexto largo | Responde a una pregunta de decisión a partir de un paquete versionado de documentos. | Cada afirmación con consecuencias está respaldada por los documentos proporcionados. |
Fija cada prompt, commit del repositorio, fixture, definición de herramientas, evaluador y límite de tiempo antes de la primera ejecución. Usa una decisión de aceptación binaria para el cálculo del coste, aunque una rúbrica más detallada ayude a diagnosticar los fallos. Si falla una prueba crítica o se inventa una cita, una respuesta pulida sigue sin ser una tarea aceptada.
Ejecuta los candidatos en un orden aleatorio o alternado para que una ralentización temporal del proveedor no afecte solo a un modelo. Repite suficientes tareas para mostrar la variación e informa de intervalos de confianza cuando la muestra lo permita. Con una muestra muy pequeña, publica los recuentos brutos y describe el resultado como direccional.
El coste por tarea aceptada incluye los intentos rechazados
Para cada intento de API, calcula el cargo del proveedor a partir del uso registrado:
attempt cost = (uncached input × input rate + cached input × cache rate + output × output rate) / 1,000,000 + separate tool charges
Después incluye todos los intentos en el numerador:
cost per accepted task = total cost of first attempts and retries / accepted tasks
Supón que una evaluación de 20 tareas realiza 20 primeros intentos y repite seis resultados rechazados. Cuatro reintentos pasan, así que se aceptan 18 tareas tras 26 llamadas en total. Si esas llamadas cuestan 3,60 $, la cifra útil es $3.60 / 18 = $0.20 per accepted task. Dividir entre 26 solicitudes respondería a otra pregunta y haría que los fallos parecieran más baratos.
Mantén la tabla de resultados lo bastante sencilla para auditarla:
| Medición | Por qué pertenece al resultado |
|---|---|
| Tareas aceptadas / tareas totales | Muestra el éxito de las tareas sin ocultar el denominador. |
| Gasto total de API | Captura la mezcla real de tokens, el comportamiento de la caché y los reintentos. |
| Coste por tarea aceptada | Conecta el gasto con el trabajo completado. |
| Aceptación en el primer intento y tasa de reintentos | Separa una ejecución barata y fiable de fallos repetidos de bajo coste. |
| Tiempo de tarea mediano y del percentil 95 | Expone los valores atípicos lentos que pueden ocultar las medias. |
| Minutos de revisión o reparación humana | Evita que el ahorro de la API oculte trabajo adicional del personal. |
| Tokens de entrada, caché, razonamiento y respuesta | Explica por qué la factura difiere de la tarifa destacada. |
| Categorías de fallo | Muestra si los errores proceden del razonamiento, las herramientas, el formato, los límites o el proveedor. |
Este artículo no publica una comparación nueva de endpoints: no se realizó para él una ejecución controlada de Grok 4.6 frente a un competidor. El ejemplo numérico anterior es ilustrativo, no un resultado medido del modelo. Ese límite importa porque una precisión inventada derrotaría el método de evaluación que recomienda el artículo.
Regla práctica de decisión
Grok 4.6 merece una prueba específica de la carga de trabajo cuando sus puntos fuertes publicados coinciden con el trabajo del equipo y este puede tolerar la latencia observada del endpoint. Empieza con un esfuerzo de razonamiento fijo y prompts por debajo del umbral de precio de 200.000 tokens. Añade el contexto largo, un razonamiento más profundo y las herramientas como experimentos separados para que su efecto siga siendo visible.
Adopta un modelo solo cuando gane en la medida que necesite el producto: trabajo aceptado por dólar, trabajo aceptado por minuto o trabajo aceptado por hora de revisor. Mantén la fiabilidad, el tratamiento de datos, los límites de velocidad, la disponibilidad regional y el coste de migración como columnas explícitas de decisión, en lugar de comprimirlos en una sola puntuación de benchmark.
Nuestro explicador de evaluación de IA explica por qué el diseño de las pruebas da forma al comportamiento del producto. El análisis del despliegue local de Qwen aplica el mismo principio al hardware, la memoria y el coste operativo. Para Grok 4.6, el siguiente resultado útil no es otra captura de una tabla de clasificación compuesta. Es evidencia de que la tarifa de tokens más baja resiste los reintentos, los fallos, la latencia y la factura de los resultados aceptados.
Fuentes
- SpaceXAI Grok 4.6 announcement
- Grok 4.6 model card
- SpaceXAI Grok 4.6 API documentation
- SpaceXAI Grok 4.6 model pricing
- SpaceXAI API release notes
- Artificial Analysis Grok 4.6 benchmark analysis
- Artificial Analysis Grok 4.6 model and provider results
- Artificial Analysis intelligence benchmarking methodology
- Axios on Grok 4.6 returning SpaceXAI to the model frontier