La factura de la reproducibilidad: 918 artículos de IA cartografían el coste de los artefactos ausentes

Un estudio de 918 artículos cartografía el coste de reproducir la investigación en IA. Usa sus hallazgos para presupuestar código, datos, cómputo y tiempo de revisión.

Comparte este artículo

Una revisión de 918 artículos empíricos de IA descubrió que el 6,72 % de las URL de implementación proporcionadas por los autores estaban vacías o devolvían un error. Es el fallo más temprano posible en un intento de reproducción: antes de alquilar una GPU, obtener datos o comprobar un benchmark, la ruta anunciada hacia el código se acaba.

El estudio, publicado en Patterns el 27 de agosto, convierte esa fricción en una puntuación de 1 a 10 en cinco tipos de documentación ausente. Su «coste» es una estimación del trabajo adicional, no una factura de nube, y los investigadores no ejecutaron los 918 artículos. El resultado se entiende mejor como un mapa de la deuda documental.

Ese mapa se vuelve más práctico al colocarlo junto al reto de reproducción con agentes de ICML 2026, donde se juzgaron bitácoras públicas afirmación por afirmación. Un participante informa de que hizo pasar 147 artículos por un flujo con muchas puertas de control en 16 días. Juntos, los dos proyectos muestran dónde empieza un presupuesto de reproducción, qué comprobaciones baratas deben preceder al cómputo y cuándo la falta de material debería detener el intento.

Cinco tipos de documentación crean la primera factura

Thijs Snelleman, Holger Hoos y Odd Erik Gundersen comenzaron con 1.061 artículos publicados entre 2022 y 2024 en AAAI, IJCAI, ICLR, ICML, NeurIPS, JAIR y JMLR. Excluyeron 143 artículos teóricos del análisis efectivo, dejando 918 estudios empíricos.

Cada artículo recibió una puntuación en cinco dimensiones:

  • Implementación: el esfuerzo necesario para reconstruir el método cuando faltan código, pseudocódigo, diseños o descripciones prácticas.
  • Datos: el esfuerzo necesario para obtener los mismos datos, justificar un sustituto comparable o documentar una nueva adquisición.
  • Configuración: el trabajo necesario para recuperar hiperparámetros, ajustes semánticos, semillas y el presupuesto con el que se eligieron esos ajustes.
  • Procedimiento experimental: los pasos ausentes entre un método ejecutable y la métrica, la línea base, el análisis y la conclusión comunicados por el artículo.
  • Experiencia: el conocimiento especializado que un investigador independiente debe adquirir porque la documentación no lo proporciona.

El estudio deja deliberadamente fuera de esta rúbrica los requisitos de hardware. Por tanto, un modelo puede obtener una buena puntuación documental y seguir siendo demasiado caro para entrenarlo en un laboratorio pequeño. A la inversa, un experimento barato en CPU puede tener una puntuación alta porque reproducirlo exige adivinar. «Bajo coste» significa una ruta más clara a través de los materiales de los autores, no una ejecución barata.

En toda la muestra, el 70,52 % de los artículos hizo pública una implementación y el 94,01 % utilizó datos públicos. El resultado de los enlaces rotos tiene un denominador más estrecho que el titular de 918 artículos: el 6,72 % de las URL de implementación proporcionadas, no el 6,72 % de los artículos, estaban vacías o daban error.

La comparación entre sedes también era relativa. Los autores informan de que, por término medio, los artículos de las tres conferencias de aprendizaje automático costaban un 16,52 % menos de reproducir que los artículos de las conferencias generales de IA y un 12,91 % menos que los artículos de revista de esta muestra. Esas cifras comparan puntuaciones ordinales de documentación entre grupos. No pueden poner precio a una reproducción concreta ni demostrar que su resultado sobrevivirá a una repetición.

Un revisor realiza la mayor parte de la medición

La revisión principal de cada artículo corrió a cargo del primer autor del estudio. Catorce voluntarios independientes aportaron una segunda revisión para 46 artículos, el 5,01 % del conjunto de 918.

La concordancia se calificó como excelente para implementación, datos y configuración; buena para procedimiento experimental; y moderada para experiencia. El patrón es informativo: un revisor suele poder verificar si existe un repositorio o una tabla de parámetros, mientras que estimar cuánto conocimiento del dominio debe adquirir otro investigador depende más del criterio.

Los autores del estudio publicaron sus datos y código de análisis en un registro versionado de Zenodo, de modo que se pueden inspeccionar la rúbrica y los cálculos. El archivo mejora la auditabilidad, pero la reducida muestra de segundas revisiones sigue limitando la confianza con que deben interpretarse pequeñas diferencias entre sedes.

Los artículos premiados no recibieron costes medios menores que otros artículos de la misma sede. En otras palabras, el prestigio no era un atajo fiable para evitar la inspección de artefactos.

La campaña de ICML pagó con puertas antes que con GPU

El reto de ICML proporciona una unidad de evidencia diferente. Sus organizadores recopilaron bitácoras públicas de Space para los artículos de la conferencia de 2026 y utilizaron un juez basado en LLM para clasificar afirmaciones individuales como verificadas, refutadas, respaldadas solo por un experimento «de juguete» a escala reducida o inconcluyentes.

AI News descargó el 31 de agosto el dataset público final de veredictos y contó 6.885 registros de bitácora de Space juzgados, que cubrían 2.176 identificadores únicos de artículos de OpenReview y 35.908 veredictos de afirmaciones. Varias bitácoras pueden dirigirse al mismo artículo, y un veredicto de LLM no equivale a una revisión humana independiente. Las cifras establecen escala operativa e intentos repetidos, no 6.885 resultados científicos confirmados.

El relato de Nate Mauer sobre una campaña dentro de ese reto informa de 147 artículos juzgados, 1.390 puntos y 76 puntuaciones perfectas en 16 días. El trabajo se ejecutó en una estación de trabajo con una GPU de 20 GB, salvo un trabajo de ajuste fino en una GPU alquilada. La primera oleada manual costó unos 52 USD; Mauer informa de unos 2,69 USD de inferencia de pago medida para la campaña automatizada posterior.

La llamativa factura de inferencia no incluye la estación de trabajo, la electricidad, el tiempo de ingeniería ni el trabajo de entrenamiento alquilado. También es una contabilidad interna de la retrospectiva de un participante, no un precio auditado de forma independiente. El hallazgo transferible es el orden de las operaciones. La campaña ejecutó puertas baratas antes de llamadas de modelos de pago o experimentos largos:

  1. Sondea el repositorio oficial y rechaza las versiones vacías.
  2. Ejecuta cada espacio de trabajo dos veces y compara la salida para revelar el no determinismo.
  3. Simula la ventana de lectura del juez para que la evidencia necesaria siga visible.
  4. Exige que cada número de la prosa que contiene afirmaciones aparezca en un archivo de resultados sin procesar.
  5. Gasta en ejecución y evaluación solo después de superar esas comprobaciones.

Esa secuencia no valida la comparación entre sedes de Patterns. Muestra cómo un operador convirtió muchas dimensiones documentales del estudio en controles de admisión.

FuenteUnidad y alcance«Coste» o resultado medidoUso legítimo
Estudio de Patterns918 artículos empíricos de siete sedes, 2022–2024Carga documental ordinal en cinco dimensionesEstimar el trabajo que añade la falta de material; comparar grupos con cautela
Dataset de veredictos de ICML6.885 registros de bitácoras de Space juzgados para 2.176 identificadores en la instantánea descargadaVeredictos de LLM sobre 35.908 registros de afirmacionesInspeccionar el rendimiento del reto, los intentos repetidos y los resultados por afirmación
Informe de campaña de MauerLos 147 artículos juzgados de un participante durante 16 díasRendimiento del flujo, gasto interno, fallos y diseño de puertasEstudiar una estrategia operativa concreta; no tratar su factura como una tarifa de mercado

Construye el presupuesto antes de abrir la cola cara

Un presupuesto de reproducción real necesita tanto el trabajo documental reducible como los recursos de ejecución irreducibles. La hoja siguiente deja deliberadamente en blanco las tarifas locales. Los precios de nube, salarios, costes de datos y la incertidumbre aceptable varían demasiado para que las puntuaciones del estudio o el gasto de un participante proporcionen valores predeterminados honestos.

Línea presupuestariaEvidencia que hay que capturar antes de ejecutarEstimaciónContinúa cuandoPausa o detén cuando
Definición de la afirmaciónAfirmación exacta, tabla o figura, métrica, línea base, tolerancia y escala necesariaHoras del evaluadorLa prueba de aceptación es explícitaNo se puede reconstruir la afirmación objetivo o la regla de decisión
Acceso al artefactoRepositorio canónico, revisión inmutable, sumas de comprobación, pesos y estado de publicaciónHoras de triaje + tarifas de accesoEl artefacto revisado se resuelve y se puede fijarLa ruta oficial está muerta y la reimplementación queda fuera del alcance
Datos y permisosVersión del dataset, división, licencia, condiciones de acceso, transformaciones y controles de datos sensiblesHoras + tarifas de adquisiciónEl equipo puede obtener legalmente o defender un dataset comparableEl permiso no está resuelto o las sustituciones cambiarían la afirmación
EntornoSO, runtime, biblioteca, controlador, contenedor, semilla y pasos de instalaciónHoras de ingenieríaUn entorno limpio supera una prueba de humo deterministaLa configuración exige parches no documentados o una arqueología ilimitada de dependencias
ConfiguraciónHiperparámetros, procedimiento de búsqueda, semillas, regla de parada y presupuesto original de ajusteHoras de búsqueda + ejecuciones candidatasSe puede reproducir el ajuste publicado o una búsqueda predeclaradaEl éxito depende de adivinar configuraciones sin un protocolo acotado
EjecuciónClase de hardware, tiempo de pared, horas de GPU o CPU, almacenamiento, salida de datos y energía cuando procedaHoras de recursos × tarifa actualLa ejecución prevista encaja en el límite aprobadoLa escala mínima fiel supera los límites de dinero, tiempo o hardware
Evaluación y revisiónSalidas sin procesar, repeticiones de la línea base, comprobaciones estadísticas, etiquetas de fallo y revisor independienteHoras de revisión + repeticionesLos resultados se pueden rastrear del comando a la conclusiónEl evaluador no puede separar un fallo del artefacto del resultado de la afirmación
ContingenciaCiclos máximos de reparación, fecha límite, techo de gasto y evidencia necesaria para otro intentoReserva explícitaCada reintento añade información diagnósticaSe alcanza el límite o los reintentos repiten el mismo fallo no explicado

La estimación resultante es suficientemente sencilla para auditar:

Presupuesto total = tarifas de acceso y datos + horas de ingeniería × tarifa cargada + horas de cómputo × tarifa de hardware + almacenamiento y salida de datos + horas de revisión × tarifa cargada + contingencia.

El campo importante es la condición de parada. Sin ella, un entorno roto puede consumir la asignación de cómputo, una licencia ausente puede dejar varado el trabajo completado y las reparaciones repetidas pueden convertir silenciosamente «una reproducción» en investigación sin límite.

Un enlace muerto termina el acceso, no la afirmación científica

Supón que el repositorio oficial de un artículo devuelve 404. El resultado correcto de admisión es artefacto no disponible en la ubicación citada. No es «afirmación refutada». Un equipo aún puede reimplementar el método a partir del artículo, localizar un archivo mantenido por los autores o probar una hipótesis más limitada, pero cada decisión cambia la ruta de evidencia y el presupuesto.

Una repetición fallida también necesita una clasificación. La causa puede ser deriva del código, un dataset cambiado, un checkpoint no disponible, entrenamiento no determinista, un evaluador no coincidente, una escala insuficiente o un desacuerdo genuino con el resultado comunicado. Solo la última posibilidad se acerca a una falsación científica, e incluso entonces las condiciones experimentales y la prueba estadística deben respaldarla.

Aquí es donde resulta útil el trabajo de evaluación adyacente. La puntuación de un benchmark depende del flujo que la produjo, mientras que la selección de modelos comienza con permisos, un artefacto ejecutable y una revisión inmutable (en español). La reproducción hereda ambas obligaciones y añade la carga de ajustarse lo suficiente a la afirmación de otro equipo para extraer una conclusión comparable.

La tasa de fallos de URL del 6,72 % parece pequeña junto a un presupuesto de entrenamiento, pero un solo enlace oficial muerto puede hacer prematuro todo ese presupuesto. La siguiente auditoría reveladora es longitudinal: vuelve a visitar los repositorios citados al cabo de un año, registra qué revisiones y datasets siguen resolviéndose y comprueba si las sedes con listas de control conservan una ruta estable desde la afirmación al comando y al resultado.

Fuentes

  1. The cost of reproducibility in artificial intelligence
  2. Cost of Reproducibility Repository on Zenodo
  3. Reproducing ICML 2026 challenge
  4. ICML 2026 reproduction verdicts dataset
  5. Reproducing 147 Machine Learning Papers in 16 Days on One Workstation