Pipette publica resultados de latencia, rendimiento, memoria y calidad en muchas configuraciones, pero distintos teléfonos, entornos de ejecución y cuantizaciones no forman una clasificación única y limpia.
El chip de inferencia Jalapeño de OpenAI lidera sus pruebas publicadas, pero la latencia, la normalización de potencia, la disponibilidad y el ajuste a la carga de trabajo limitan la conclusión de compra.
llama.cpp ahora ofrece versiones semánticas junto a compilaciones nightly. Su primera etiqueta estable comparte código con una etiqueta de compilación, lo que muestra que los nombres de canal describen una política, no la calidad.
Waymo ha revelado más de 1.000 TOPS de computación de IA personalizada en el borde, pero no ha publicado la precisión, potencia, utilización, ancho de banda de memoria ni latencia medida.
Las cuantizaciones compactas de Qwen3.8-27B pueden ejecutarse en una GPU de 16GB, pero el contexto largo, la visión, la concurrencia y la memoria del runtime hacen que ese titular sea incompleto.