Kubernetes Inference Perf: compara el stack de serving, no solo el modelo
Kubernetes Inference Perf hace más coherentes las comparaciones entre servidores de modelos, pero sus resultados siguen dependiendo de los prompts, los patrones de carga, el número de tokens y los clústeres.