La factura de la reproducibilidad: 918 artículos de IA cartografían el coste de los artefactos ausentes
Un estudio de 918 artículos cartografía el coste de reproducir la investigación en IA. Usa sus hallazgos para presupuestar código, datos, cómputo y tiempo de revisión.
Una revisión de 918 artículos empíricos de IA descubrió que el 6,72 % de las URL de implementación proporcionadas por los autores estaban vacías o devolvían un error. Es el fallo más temprano posible en un intento de reproducción: antes de alquilar una GPU, obtener datos o comprobar un benchmark, la ruta anunciada hacia el código se acaba.
El estudio, publicado en Patterns el 27 de agosto, convierte esa fricción en una puntuación de 1 a 10 en cinco tipos de documentación ausente. Su «coste» es una estimación del trabajo adicional, no una factura de nube, y los investigadores no ejecutaron los 918 artículos. El resultado se entiende mejor como un mapa de la deuda documental.
Ese mapa se vuelve más práctico al colocarlo junto al reto de reproducción con agentes de ICML 2026, donde se juzgaron bitácoras públicas afirmación por afirmación. Un participante informa de que hizo pasar 147 artículos por un flujo con muchas puertas de control en 16 días. Juntos, los dos proyectos muestran dónde empieza un presupuesto de reproducción, qué comprobaciones baratas deben preceder al cómputo y cuándo la falta de material debería detener el intento.
Cinco tipos de documentación crean la primera factura
Thijs Snelleman, Holger Hoos y Odd Erik Gundersen comenzaron con 1.061 artículos publicados entre 2022 y 2024 en AAAI, IJCAI, ICLR, ICML, NeurIPS, JAIR y JMLR. Excluyeron 143 artículos teóricos del análisis efectivo, dejando 918 estudios empíricos.
Cada artículo recibió una puntuación en cinco dimensiones:
- Implementación: el esfuerzo necesario para reconstruir el método cuando faltan código, pseudocódigo, diseños o descripciones prácticas.
- Datos: el esfuerzo necesario para obtener los mismos datos, justificar un sustituto comparable o documentar una nueva adquisición.
- Configuración: el trabajo necesario para recuperar hiperparámetros, ajustes semánticos, semillas y el presupuesto con el que se eligieron esos ajustes.
- Procedimiento experimental: los pasos ausentes entre un método ejecutable y la métrica, la línea base, el análisis y la conclusión comunicados por el artículo.
- Experiencia: el conocimiento especializado que un investigador independiente debe adquirir porque la documentación no lo proporciona.
El estudio deja deliberadamente fuera de esta rúbrica los requisitos de hardware. Por tanto, un modelo puede obtener una buena puntuación documental y seguir siendo demasiado caro para entrenarlo en un laboratorio pequeño. A la inversa, un experimento barato en CPU puede tener una puntuación alta porque reproducirlo exige adivinar. «Bajo coste» significa una ruta más clara a través de los materiales de los autores, no una ejecución barata.
En toda la muestra, el 70,52 % de los artículos hizo pública una implementación y el 94,01 % utilizó datos públicos. El resultado de los enlaces rotos tiene un denominador más estrecho que el titular de 918 artículos: el 6,72 % de las URL de implementación proporcionadas, no el 6,72 % de los artículos, estaban vacías o daban error.
La comparación entre sedes también era relativa. Los autores informan de que, por término medio, los artículos de las tres conferencias de aprendizaje automático costaban un 16,52 % menos de reproducir que los artículos de las conferencias generales de IA y un 12,91 % menos que los artículos de revista de esta muestra. Esas cifras comparan puntuaciones ordinales de documentación entre grupos. No pueden poner precio a una reproducción concreta ni demostrar que su resultado sobrevivirá a una repetición.
Un revisor realiza la mayor parte de la medición
La revisión principal de cada artículo corrió a cargo del primer autor del estudio. Catorce voluntarios independientes aportaron una segunda revisión para 46 artículos, el 5,01 % del conjunto de 918.
La concordancia se calificó como excelente para implementación, datos y configuración; buena para procedimiento experimental; y moderada para experiencia. El patrón es informativo: un revisor suele poder verificar si existe un repositorio o una tabla de parámetros, mientras que estimar cuánto conocimiento del dominio debe adquirir otro investigador depende más del criterio.
Los autores del estudio publicaron sus datos y código de análisis en un registro versionado de Zenodo, de modo que se pueden inspeccionar la rúbrica y los cálculos. El archivo mejora la auditabilidad, pero la reducida muestra de segundas revisiones sigue limitando la confianza con que deben interpretarse pequeñas diferencias entre sedes.
Los artículos premiados no recibieron costes medios menores que otros artículos de la misma sede. En otras palabras, el prestigio no era un atajo fiable para evitar la inspección de artefactos.
La campaña de ICML pagó con puertas antes que con GPU
El reto de ICML proporciona una unidad de evidencia diferente. Sus organizadores recopilaron bitácoras públicas de Space para los artículos de la conferencia de 2026 y utilizaron un juez basado en LLM para clasificar afirmaciones individuales como verificadas, refutadas, respaldadas solo por un experimento «de juguete» a escala reducida o inconcluyentes.
AI News descargó el 31 de agosto el dataset público final de veredictos y contó 6.885 registros de bitácora de Space juzgados, que cubrían 2.176 identificadores únicos de artículos de OpenReview y 35.908 veredictos de afirmaciones. Varias bitácoras pueden dirigirse al mismo artículo, y un veredicto de LLM no equivale a una revisión humana independiente. Las cifras establecen escala operativa e intentos repetidos, no 6.885 resultados científicos confirmados.
El relato de Nate Mauer sobre una campaña dentro de ese reto informa de 147 artículos juzgados, 1.390 puntos y 76 puntuaciones perfectas en 16 días. El trabajo se ejecutó en una estación de trabajo con una GPU de 20 GB, salvo un trabajo de ajuste fino en una GPU alquilada. La primera oleada manual costó unos 52 USD; Mauer informa de unos 2,69 USD de inferencia de pago medida para la campaña automatizada posterior.
La llamativa factura de inferencia no incluye la estación de trabajo, la electricidad, el tiempo de ingeniería ni el trabajo de entrenamiento alquilado. También es una contabilidad interna de la retrospectiva de un participante, no un precio auditado de forma independiente. El hallazgo transferible es el orden de las operaciones. La campaña ejecutó puertas baratas antes de llamadas de modelos de pago o experimentos largos:
- Sondea el repositorio oficial y rechaza las versiones vacías.
- Ejecuta cada espacio de trabajo dos veces y compara la salida para revelar el no determinismo.
- Simula la ventana de lectura del juez para que la evidencia necesaria siga visible.
- Exige que cada número de la prosa que contiene afirmaciones aparezca en un archivo de resultados sin procesar.
- Gasta en ejecución y evaluación solo después de superar esas comprobaciones.
Esa secuencia no valida la comparación entre sedes de Patterns. Muestra cómo un operador convirtió muchas dimensiones documentales del estudio en controles de admisión.
| Fuente | Unidad y alcance | «Coste» o resultado medido | Uso legítimo |
|---|---|---|---|
| Estudio de Patterns | 918 artículos empíricos de siete sedes, 2022–2024 | Carga documental ordinal en cinco dimensiones | Estimar el trabajo que añade la falta de material; comparar grupos con cautela |
| Dataset de veredictos de ICML | 6.885 registros de bitácoras de Space juzgados para 2.176 identificadores en la instantánea descargada | Veredictos de LLM sobre 35.908 registros de afirmaciones | Inspeccionar el rendimiento del reto, los intentos repetidos y los resultados por afirmación |
| Informe de campaña de Mauer | Los 147 artículos juzgados de un participante durante 16 días | Rendimiento del flujo, gasto interno, fallos y diseño de puertas | Estudiar una estrategia operativa concreta; no tratar su factura como una tarifa de mercado |
Construye el presupuesto antes de abrir la cola cara
Un presupuesto de reproducción real necesita tanto el trabajo documental reducible como los recursos de ejecución irreducibles. La hoja siguiente deja deliberadamente en blanco las tarifas locales. Los precios de nube, salarios, costes de datos y la incertidumbre aceptable varían demasiado para que las puntuaciones del estudio o el gasto de un participante proporcionen valores predeterminados honestos.
| Línea presupuestaria | Evidencia que hay que capturar antes de ejecutar | Estimación | Continúa cuando | Pausa o detén cuando |
|---|---|---|---|---|
| Definición de la afirmación | Afirmación exacta, tabla o figura, métrica, línea base, tolerancia y escala necesaria | Horas del evaluador | La prueba de aceptación es explícita | No se puede reconstruir la afirmación objetivo o la regla de decisión |
| Acceso al artefacto | Repositorio canónico, revisión inmutable, sumas de comprobación, pesos y estado de publicación | Horas de triaje + tarifas de acceso | El artefacto revisado se resuelve y se puede fijar | La ruta oficial está muerta y la reimplementación queda fuera del alcance |
| Datos y permisos | Versión del dataset, división, licencia, condiciones de acceso, transformaciones y controles de datos sensibles | Horas + tarifas de adquisición | El equipo puede obtener legalmente o defender un dataset comparable | El permiso no está resuelto o las sustituciones cambiarían la afirmación |
| Entorno | SO, runtime, biblioteca, controlador, contenedor, semilla y pasos de instalación | Horas de ingeniería | Un entorno limpio supera una prueba de humo determinista | La configuración exige parches no documentados o una arqueología ilimitada de dependencias |
| Configuración | Hiperparámetros, procedimiento de búsqueda, semillas, regla de parada y presupuesto original de ajuste | Horas de búsqueda + ejecuciones candidatas | Se puede reproducir el ajuste publicado o una búsqueda predeclarada | El éxito depende de adivinar configuraciones sin un protocolo acotado |
| Ejecución | Clase de hardware, tiempo de pared, horas de GPU o CPU, almacenamiento, salida de datos y energía cuando proceda | Horas de recursos × tarifa actual | La ejecución prevista encaja en el límite aprobado | La escala mínima fiel supera los límites de dinero, tiempo o hardware |
| Evaluación y revisión | Salidas sin procesar, repeticiones de la línea base, comprobaciones estadísticas, etiquetas de fallo y revisor independiente | Horas de revisión + repeticiones | Los resultados se pueden rastrear del comando a la conclusión | El evaluador no puede separar un fallo del artefacto del resultado de la afirmación |
| Contingencia | Ciclos máximos de reparación, fecha límite, techo de gasto y evidencia necesaria para otro intento | Reserva explícita | Cada reintento añade información diagnóstica | Se alcanza el límite o los reintentos repiten el mismo fallo no explicado |
La estimación resultante es suficientemente sencilla para auditar:
Presupuesto total = tarifas de acceso y datos + horas de ingeniería × tarifa cargada + horas de cómputo × tarifa de hardware + almacenamiento y salida de datos + horas de revisión × tarifa cargada + contingencia.
El campo importante es la condición de parada. Sin ella, un entorno roto puede consumir la asignación de cómputo, una licencia ausente puede dejar varado el trabajo completado y las reparaciones repetidas pueden convertir silenciosamente «una reproducción» en investigación sin límite.
Un enlace muerto termina el acceso, no la afirmación científica
Supón que el repositorio oficial de un artículo devuelve 404. El resultado correcto de admisión es artefacto no disponible en la ubicación citada. No es «afirmación refutada». Un equipo aún puede reimplementar el método a partir del artículo, localizar un archivo mantenido por los autores o probar una hipótesis más limitada, pero cada decisión cambia la ruta de evidencia y el presupuesto.
Una repetición fallida también necesita una clasificación. La causa puede ser deriva del código, un dataset cambiado, un checkpoint no disponible, entrenamiento no determinista, un evaluador no coincidente, una escala insuficiente o un desacuerdo genuino con el resultado comunicado. Solo la última posibilidad se acerca a una falsación científica, e incluso entonces las condiciones experimentales y la prueba estadística deben respaldarla.
Aquí es donde resulta útil el trabajo de evaluación adyacente. La puntuación de un benchmark depende del flujo que la produjo, mientras que la selección de modelos comienza con permisos, un artefacto ejecutable y una revisión inmutable (en español). La reproducción hereda ambas obligaciones y añade la carga de ajustarse lo suficiente a la afirmación de otro equipo para extraer una conclusión comparable.
La tasa de fallos de URL del 6,72 % parece pequeña junto a un presupuesto de entrenamiento, pero un solo enlace oficial muerto puede hacer prematuro todo ese presupuesto. La siguiente auditoría reveladora es longitudinal: vuelve a visitar los repositorios citados al cabo de un año, registra qué revisiones y datasets siguen resolviéndose y comprueba si las sedes con listas de control conservan una ruta estable desde la afirmación al comando y al resultado.