Pipette publica resultados de latencia, rendimiento, memoria y calidad en muchas configuraciones, pero distintos teléfonos, entornos de ejecución y cuantizaciones no forman una clasificación única y limpia.
ASI-Bench prueba agentes científicos mientras desaparece la orientación humana. Su mayor caída de puntuación revela un problema de construcción de procedimientos, no una prueba sobre la superinteligencia.
El chip de inferencia Jalapeño de OpenAI lidera sus pruebas publicadas, pero la latencia, la normalización de potencia, la disponibilidad y el ajuste a la carga de trabajo limitan la conclusión de compra.
AVO de NVIDIA superó el conjunto público de ARC-AGI-3, pero el benchmark no aísla la contribución del arnés ni prueba la generalización en tareas privadas.
llama.cpp ahora ofrece versiones semánticas junto a compilaciones nightly. Su primera etiqueta estable comparte código con una etiqueta de compilación, lo que muestra que los nombres de canal describen una política, no la calidad.
Grok 4.6 combina un precio anunciado bajo con benchmarks publicados sólidos, pero los reintentos, las tareas fallidas, la latencia y los cargos de herramientas pueden invertir la ventaja aparente.
Una mirada práctica a cómo las decisiones de evaluación influyen en las afirmaciones sobre modelos, las decisiones de producto y lo que los lectores deben revisar en los anuncios de IA.