WorldCup Arena evita la filtración, pero su clasificación no es un veredicto
WorldCup Arena prueba las previsiones de los LLM antes de que existan los resultados, pero la puntuación cambia la clasificación y el archivo público no incluye todas las llamadas originales al modelo.
WorldCup Arena pidió a seis grandes modelos de lenguaje que pronosticaran cada partido de la Copa Mundial de la FIFA 2026 antes del saque inicial, y después puntuó 4.494 predicciones bloqueadas frente a resultados que aún no existían cuando los modelos respondieron. Ese calendario da al experimento una fortaleza poco común: un modelo no podía recordar el resultado a partir de sus datos de entrenamiento ni recuperarlo de la web antes de que se jugara el partido.
La clasificación resultante es mucho menos concluyente. Los seis sistemas promediaron un 63,9 % de acierto en la tarea de resultado de partido con tres opciones, frente al 64,4 % de elegir mecánicamente al equipo favorecido por la línea fija de la casa de apuestas. Cambiar únicamente la agregación de la puntuación produjo tres ganadores distintos, mientras que la ventaja en puntos de partido del modelo líder sobre otro sistema destacado tuvo un intervalo bootstrap que cruzaba el cero.
Al eliminar la filtración de respuestas, el resto de la evaluación sigue abierto al escrutinio. La elección de la tarea, la recuperación, la puntuación, la incertidumbre y el acceso a los artefactos siguen limitando lo que significa la clasificación.
Tres bloqueos mantienen cada predicción por delante de su resultado
El preprint de WorldCup Arena del 4 de agosto describe una ejecución de 39 días que cubrió los 104 partidos del torneo. Antes de cada saque inicial, todos los sistemas recibían el mismo encabezado del encuentro, una línea fija de hándicap de la casa de apuestas y dosieres actualizados de los dos equipos. Los modelos también podían utilizar la búsqueda web nativa del lado del servidor de sus proveedores.
Cada sistema se comprometió con siete mercados de elección única: hándicap, descanso/final, resultado del partido, más o menos de 2,5 goles, ambos equipos marcan, marcador exacto y total de goles par o impar. Los autores también solicitaron los 12 ganadores de grupo y una quiniela previa al torneo que cubría el campeón, los finalistas, los semifinalistas, la confederación ganadora y un umbral de goles totales.
El protocolo empleó tres bloqueos procedimentales:
- El bloqueo de instantánea solo ofrecía la versión del dosier vigente antes de ese partido. Los resultados solo entraban en instantáneas posteriores una vez transcurrida la fecha del encuentro correspondiente.
- El bloqueo del saque inicial exigía que cada llamada al modelo terminara antes del comienzo del juego, lo que impedía que un modelo con búsqueda recuperara el resultado en directo.
- El bloqueo de la plantilla fijaba el prompt, los mercados, los pesos de puntuación y la línea de hándicap antes de llamar a los seis sistemas.
Estos controles abordan directamente la filtración temporal de respuestas. Una prueba retrospectiva normalmente tiene que estimar si un modelo memorizó una respuesta publicada, o esconder los detalles lo suficiente para que la respuesta no pueda reconstruirse. WorldCup Arena eligió, en cambio, preguntas cuyas respuestas aún no se habían creado.
«Sin filtración» debe seguir entendiéndose en el límite de la respuesta. Los sistemas podían buscar noticias públicas de los equipos, cuotas, lesiones y análisis disponibles antes del saque inicial. Esa información es evidencia legítima para pronosticar, no una filtración. Por tanto, el benchmark mide una configuración de extremo a extremo que incluye una familia de modelos, el sistema de búsqueda de su proveedor, el prompt y los dosieres, y la regla de puntuación. No aísla el razonamiento de un modelo base sin ayuda.
La línea de la casa de apuestas importa más que el ganador
La comparación más informativa del artículo no es el primer puesto frente al sexto. Es la cohorte de seis sistemas frente a una sencilla línea base de consenso público.
En los 104 partidos, los modelos promediaron un 63,9 % de acierto en victoria local, empate o victoria visitante. Elegir siempre al equipo favorecido por la línea fija de hándicap del benchmark alcanzó un 64,4 %. Solo un sistema superó esa línea base, por dos partidos. El voto mayoritario de los seis alcanzó el 65,4 %, que los autores describen como un resultado dentro del ruido del mejor resultado individual.
Los modelos también compartieron errores reconocibles. Predijeron menos empates que los 27 que ocurrieron, subestimaron los goles totales y concentraron el 28 % de las selecciones de marcador exacto en 2–1. El rendimiento cayó en los cruces eliminatorios igualados, aunque para entonces los dosieres actualizados eran más completos. Esos patrones respaldan una conclusión estrecha: los sistemas a menudo comprimieron los partidos inciertos hacia el mismo pronóstico futbolístico convencional.
No demuestran que los LLM que usan herramientas no tengan ningún valor predictivo. La tarea dio a cada sistema una línea de la casa de apuestas y permitió la búsqueda en directo, y después evaluó un torneo inusualmente corto y de gran varianza. Un profesional debería reconocer el diseño prospectivo, pero resistirse al salto de «no superó este ancla futbolística» a «no puede pronosticar ningún acontecimiento cambiante».
Cinco marcadores, tres ganadores
WorldCup Arena asigna pesos de puntos distintos a sus siete mercados y después añade puntos separados para los grupos y la quiniela del torneo. Eso produce una visión legítima del rendimiento, pero no es un hecho neutral de la naturaleza.
Los autores volvieron a puntuar las mismas predicciones bloqueadas de cinco maneras. Un sistema ganó la visión de los mercados de partidos, la primera mitad y el marcador completo. Otro ganó la segunda mitad. Un tercero ganó cuando cada jornada se normalizó a 100 antes de calcular el promedio. Todos los sistemas lideraron al menos una de las 34 jornadas, y el artículo informa de que, tras la normalización, la dispersión media dentro de una jornada era aproximadamente diez veces mayor que la dispersión de todo el torneo.
| Lectura del archivo | Qué cambia | Qué puede respaldar el ganador |
|---|---|---|
| Solo mercados de partidos | Excluye las preguntas de grupos y quiniela del torneo | Mejor total con los pesos de partidos declarados de antemano |
| Primera o segunda mitad | Cambia los encuentros y las fases del torneo incluidas | Rendimiento durante esa parte de este torneo |
| Marcador completo | Añade los ganadores de grupo y la quiniela previa al torneo | Mejor total según el esquema de ponderación completo del artículo |
| Índice normalizado por jornada | Da el mismo peso a cada jornada después de reescalar | Mejor posición relativa media a lo largo de las jornadas |
Los investigadores no ocultaron esta sensibilidad; es uno de sus resultados más sólidos. Si una clasificación cambia cuando cambia una agregación defendible, debería comunicarse como un conjunto de comparaciones condicionadas por la tarea, no convertirse en un orden universal de los modelos subyacentes.
La incertidumbre refuerza la misma lectura. El artículo aplicó bootstrap a los 104 partidos 10.000 veces. La diferencia de puntuación de partidos comunicada entre el sistema líder y GPT fue de 22 puntos, con un intervalo del 95 % de -49 a 94. Ese intervalo no identifica un ganador estable entre esas dos configuraciones.
Este benchmark no mide la calibración
La calibración pregunta si las probabilidades declaradas coinciden con las frecuencias observadas. Si un sistema asigna una probabilidad del 70 % a muchos acontecimientos, un pronosticador bien calibrado debería acertar aproximadamente el 70 % de las veces en casos comparables.
Las salidas puntuadas de WorldCup Arena son elecciones únicas, no distribuciones de probabilidad. Su precisión y sus puntos ponderados pueden comparar selecciones, pero no revelan si un modelo tenía un nivel de incertidumbre adecuado. Una elección confiada del 51 % y una elección dubitativa del 34 % se convierten en la misma selección categórica.
Un preprint independiente con un nombre similar, WorldCupArena, ilustra la diferencia de diseño. Ese proyecto evalúa 13 sistemas en probabilidades de resultados, distribuciones de marcadores, predicciones de jugadores y eventos, estadísticas de partidos y resultados del torneo. Su implementación de código abierto utiliza puntuaciones de Brier y de probabilidad ordinal para los resultados principales, junto con métricas específicas de cada tarea para los demás campos.
Los dos estudios no son réplicas independientes: utilizan sistemas, prompts, condiciones de evidencia, esquemas de salida, métricas y pesos compuestos diferentes. Resultan útiles juntos porque muestran cómo la pregunta de evaluación determina la evidencia. Los mercados de elección única facilitan resolver una ejecución en directo de forma coherente. Las previsiones probabilísticas permiten medir la calibración. Ningún diseño debería tomar prestadas las afirmaciones del otro.
El código público no es un registro público de cada llamada original
Los autores de WorldCup Arena publicaron materiales sustanciales. El repositorio público incluye el flujo para construir los dosieres, ensamblar prompts, enrutar a los proveedores, liquidar, puntuar y analizar. El conjunto de datos enlazado contiene 48 dosieres de equipos en 46 instantáneas con marca temporal, los 104 encuentros, metadatos de equipos y sedes y los resultados oficiales. El artículo afirma que una puntuación determinista sobre dos archivos JSON congelados regenera sus totales y figuras.
Sin embargo, el repositorio también declara que las predicciones de los autores, las respuestas de los modelos en bruto y los prompts archivados se conservan para auditoría, pero deliberadamente no se publican. El artículo dice que un sitio público del proyecto ofrece tarjetas de elección por partido y la clasificación, pero eso no equivale a publicar las respuestas brutas de los proveedores, los metadatos de las solicitudes y el archivo completo de predicciones utilizado en el análisis.
Los artefactos disponibles respaldan dos niveles diferentes de reproducibilidad:
| Pregunta de reproducibilidad | Evidencia pública actual |
|---|---|
| ¿Puede otro equipo inspeccionar las entradas del benchmark, el flujo, la puntuación y el análisis agregado comunicado? | En gran medida sí, mediante el código, los dosieres congelados, los encuentros, los resultados y el sitio público de resultados |
| ¿Puede otro equipo verificar cada respuesta original del modelo y volver a ejecutar la puntuación exacta a partir de un archivo público completo de predicciones en bruto? | No; los autores conservan esos artefactos para auditoría |
| ¿Puede otro equipo repetir el protocolo con los modelos actuales de los proveedores? | En principio sí, pero diferirán las versiones de los modelos, la búsqueda del lado del servidor, el comportamiento del proveedor y el contenido web en directo |
| ¿Puede otro equipo recrear la condición prospectiva en el mismo torneo? | No; los resultados ya son públicos, así que hace falta un acontecimiento nuevo |
La última limitación es fundamental. Una vez terminada la Copa Mundial, la tarea ya no está libre de filtraciones para una nueva ejecución. El protocolo puede reutilizarse, pero su condición prospectiva limpia se traslada al siguiente acontecimiento.
Un sitio independiente, WorldCupBenchmark, ofrece una comparación pública más sencilla: cuatro sistemas bloquearon sus cuadros completos del torneo antes del partido inaugural y reciben un punto por cada pronóstico correcto. Su metodología indica que la puntuación de las jornadas sigue pendiente. Esa implementación pública corrobora el interés por evaluar acontecimientos futuros bloqueados, pero no valida los resultados de los siete mercados de WorldCup Arena ni reproduce su protocolo de dosieres actualizados.
La próxima prueba limpia necesita un futuro nuevo
La contribución de WorldCup Arena no es una tabla definitiva de modelos. Es una demostración concreta de que un problema de contaminación puede desaparecer cuando una evaluación espera a que la realidad cree las respuestas.
Sus propios resultados proporcionan después la etiqueta de advertencia. Los seis sistemas siguieron en gran medida el mismo consenso informado por las casas de apuestas, su orden dependió de la perspectiva de puntuación y los artefactos públicos no llegan a un registro en bruto completo de las llamadas originales. Un seguimiento más sólido debería preregistrar una regla de puntuación basada en probabilidades, publicar comprobantes de predicción inmutables y salidas en bruto, incluir líneas base estadísticas y de mercado sencillas y repetir el protocolo en varios acontecimientos futuros no relacionados.
Esa prueba no puede repetirse en la Copa Mundial de 2026. El calendario ya ha convertido sus respuestas en datos de entrenamiento.