ASI-Bench descubre que los agentes de IA tienen dificultades sin un procedimiento de investigación

ASI-Bench prueba agentes científicos mientras desaparece la orientación humana. Su mayor caída de puntuación revela un problema de construcción de procedimientos, no una prueba sobre la superinteligencia.

Comparte este artículo

Los agentes de IA perdieron casi la mitad de su puntuación media cuando ASI-Bench eliminó un procedimiento de investigación detallado escrito por humanos. El nuevo preprint prueba 18 configuraciones de modelos y agentes en 60 proyectos de investigación computacional, repitiendo cada proyecto con una orientación metodológica progresivamente menor.

El resultado titular es real dentro del experimento de los autores, pero es fácil pasar por alto la interpretación más útil. El rendimiento medio cayó de 50,91 con un procedimiento completo a 29,10 cuando los agentes recibieron solo el nombre del método. Quitar incluso ese nombre redujo la media otros 2,48 puntos, hasta 26,62. En esta prueba, convertir un método científico nombrado en una secuencia funcional fue un obstáculo mayor que elegir el método.

Es evidencia sobre un benchmark controlado de ejecución científica. No es evidencia de que los sistemas descubrieran ciencia nueva, una predicción de superinteligencia artificial ni una medida reproducida de forma independiente de la productividad investigadora.

Cuatro versiones de un proyecto trasladan la responsabilidad al agente

El artículo de ASI-Bench parte de proyectos computacionales en lugar de preguntas aisladas. Sus 60 tareas abarcan 11 ámbitos, incluidos física, química, biología, medicina y bioestadística, robótica e ingeniería eléctrica. Cada tarea tiene datos de entrada, un entorno ejecutable, artefactos requeridos y criterios de puntuación.

La decisión clave de diseño es mantener fijos esos elementos mientras se cambia lo que revela el prompt. El benchmark llama a sus cuatro condiciones B1 a B4.

CondiciónOrientación humana proporcionadaResponsabilidad que queda al agente
B1Contexto científico, método, ecuaciones y procedimiento completoImplementar y ejecutar el enfoque prescrito
B2Método y restricciones pertinentes, sin el procedimientoConvertir el método nombrado en un flujo de trabajo ejecutable
B3Objetivo, datos, restricciones y resultados requeridosElegir un método, construir el flujo de trabajo y validar el resultado
B4B3 más información fácticamente correcta pero irrelevanteHacer el trabajo de B3 ignorando las distracciones

Una tarea representativa pide al agente inferir un sistema dinámico no lineal a partir de datos observados de espacio y tiempo. B1 proporciona la ecuación rectora, la formulación numérica y el procedimiento del solver. B2 nombra la clase de ecuación y los enfoques numéricos adecuados. B3 deja que el agente infiera el sistema y el método. El objetivo científico y los artefactos esperados no cambian.

Este diseño emparejado es más informativo que comparar tareas “fáciles” y “difíciles” no relacionadas. Una diferencia de puntuación puede conectarse con información que se eliminó deliberadamente, aunque siga reflejando todas las decisiones de modelo, arnés, prompt, tiempo de ejecución y evaluador del experimento.

Los autores informan de un proceso de construcción extenso: más de 1.300 ideas candidatas, cinco rondas de revisión, más de 1.500 ejecuciones en entornos aislados y comprobaciones de coherencia científica, reproducibilidad, filtraciones, atajos no intencionados y comportamiento de la puntuación. Son controles de desarrollo del benchmark comunicados por el mismo equipo, no una auditoría externa.

La mayor brecha aparece antes de elegir el método

La tabla principal del artículo calcula medias macro de las puntuaciones en las 60 tareas y las 18 configuraciones de agentes y modelos. La mayoría de las configuraciones se ejecutaron tres veces; un resultado de Claude Opus 5 fue una sola ejecución. La evaluación excluyó el acceso a herramientas externas.

Cambio de orientaciónMedia comunicada por los autoresDiferenciaLo que aísla más directamente la comparación
Procedimiento completo (B1)50,91Ejecución con una receta especificada por humanos
Solo el nombre del método (B2)29,10−21,82Construcción del procedimiento que falta
El agente elige el método (B3)26,62−2,48 desde B2Elección del método una vez que ya falta el procedimiento
B3 más hechos irrelevantes (B4)26,99+0,36 desde B3Resistencia a las distracciones de este benchmark

La comparación entre 50,91 y 26,62 es una caída de 24,29 puntos, aproximadamente el 48 % de la media de B1. Describir toda esa diferencia como una “brecha de selección del método” sería incorrecto. Aproximadamente nueve décimas de la pérdida de puntos se produjo cuando desapareció el procedimiento completo, pero el método previsto seguía disponible.

Los resultados de coste refuerzan esa lectura. Los autores informan de que B1 utilizó una media de 4,35 millones de tokens y 37,8 minutos por tarea. B2 fue la condición más cara, con 6,91 millones de tokens y 49,7 minutos. Un nombre de método puede orientar sin aportar suficiente detalle para implementarlo, y deja al agente la tarea de reconstruir el procedimiento mediante búsquedas y reintentos.

B4 también exige prudencia. Su media general permaneció prácticamente igual que la de B3, pero eso no demuestra que los agentes científicos sean generalmente inmunes a las distracciones. Muestra que las adiciones fácticamente correctas e irrelevantes para la tarea utilizadas aquí no redujeron la puntuación agregada. Otro contexto irrelevante, evidencia engañosa, resultados de herramientas o ruido bibliográfico requerirían pruebas separadas.

El resultado pertenece conjuntamente al modelo y al arnés

ASI-Bench evalúa configuraciones, no modelos lingüísticos sin más. Un arnés controla los archivos que ve un agente, los comandos que puede ejecutar, cómo registra el progreso y cómo gestiona los tiempos de espera y los errores. El artículo comunica puntuaciones distintas para el mismo modelo base en arneses diferentes, aunque esas comparaciones no aíslan una única característica del arnés.

La configuración B3 más fuerte comunicada, Codex con GPT-5.6 Sol en el ajuste de razonamiento ultra, obtuvo 51,60. Fue la única configuración evaluada por encima de 50 en B3. Ese resultado es comunicado por los autores y no demuestra que el modelo produzca de forma independiente conocimiento científico nuevo y válido. Establece cómo funcionó un sistema configurado frente a los evaluadores de artefactos del benchmark.

La distinción importa para las afirmaciones de compra e investigación. Un equipo no puede copiar el nombre del modelo de la tabla de clasificación y asumir que obtendrá el mismo resultado con otro prompt, política de herramientas, estrategia de contexto, entorno de ejecución o presupuesto. Nuestro análisis de NVIDIA AVO (en español) llega a la misma conclusión a partir de un benchmark interactivo: el límite del sistema se desplaza junto con la puntuación. El análisis de HarnessRisk (en español) añade otro límite que ASI-Bench no mide: si un agente de investigación capaz puede contenerse y recuperarse cuando su ejecución sale mal.

Un benchmark computacional no es un laboratorio en funcionamiento

ASI-Bench amplía la evaluación más allá de las preguntas académicas. Sus agentes deben trabajar en varios pasos, crear artefactos, diagnosticar fallos y satisfacer comprobaciones específicas del proyecto. El repositorio oficial publica un ejecutor, dos conjuntos de datos con semillas fijas, infraestructura de tareas y una vía para enviar resultados. Una semilla expone referencias para la puntuación local; la vía oficial utiliza referencias privadas para la otra.

Aun así, el benchmark sigue siendo un entorno computacional diseñado. Su resultado principal no incluye acceso a herramientas externas, la tabla no informa de una línea base humana y el artículo es un preprint versión uno del 18 de agosto. Los autores construyeron las tareas, el proceso de validación y el sistema de puntuación, y después ejecutaron las configuraciones evaluadas. Todavía ningún equipo independiente ha reproducido las transiciones de puntuación comunicadas.

La autonomía científica fuera de ese entorno añade problemas que la puntuación no cubre: elegir una pregunta de investigación valiosa, localizar evidencia incompleta o contradictoria, negociar el acceso a instrumentos o datos, realizar experimentos físicos, reconocer restricciones tácitas del laboratorio y decidir si un resultado aparente merece crédito.

Otras evaluaciones hacen visible el problema del alcance. AstaBench cubre más de 2.400 problemas a lo largo de las etapas del trabajo científico y sostiene que el acceso a herramientas, el coste y la configuración del agente son factores de confusión que una evaluación debe controlar. Un estudio de caso independiente probó ocho marcos de investigación de código abierto en dos proyectos computacionales reales y comunicó un trabajo sustancial de configuración y depuración; los sistemas resultaron más útiles como asistentes supervisados que como investigadores autónomos. Ninguno de los dos estudios valida las cifras de ASI-Bench. Juntos muestran por qué “agente científico” no es una categoría estable de tarea.

Una repetición independiente necesita más que la puntuación final

El código público hace posible una repetición seria, pero una cifra de la tabla de clasificación por sí sola no revela si la mejora provino del modelo, el arnés, el presupuesto, la exposición a las tareas o el evaluador. Un paquete de evidencia útil conservaría:

  • la semilla exacta del conjunto de datos, las revisiones de tareas y referencias, el acceso de desarrollo y la revisión de contaminación;
  • el endpoint del modelo, la revisión del modelo, el ajuste de razonamiento, la configuración de muestreo y la fecha del proveedor;
  • la revisión del arnés, los prompts, las herramientas, el límite del entorno aislado, la política de contexto, las reglas de reintento, el tiempo de espera y el presupuesto de tokens;
  • los resultados de B1 a B4 en el mismo conjunto de tareas, con repeticiones, ejecuciones no válidas, dispersión y categorías de fallo por tarea;
  • los artefactos de salida sin procesar, las versiones de los evaluadores, las trazas de puntuación y la resolución de resultados disputados o parciales; y
  • una línea base independiente humana o asistida por expertos cuando la afirmación compare el sistema con la práctica científica y no con otro agente.

Ese registro permitiría a un equipo externo probar el hallazgo más importante del artículo: si la fuerte caída de B1 a B2 se mantiene en una repetición fijada. Los experimentos posteriores podrían cambiar un límite cada vez —por ejemplo, proporcionar una herramienta de planificación estructurada manteniendo fijos el modelo, las tareas, los prompts y los presupuestos— para saber qué parte de la construcción del procedimiento está fallando.

El nombre del benchmark apunta a la superinteligencia artificial, pero su aportación más sólida es más práctica. ASI-Bench convierte la orientación metodológica humana en una variable experimental y expone una gran brecha entre recibir un procedimiento completo y tener que construirlo. Las repeticiones independientes, la evidencia de fallos por tarea y las comparaciones más allá de proyectos computacionales autocontenidos determinarán hasta dónde viaja ese resultado.

Fuentes

  1. ASI-Bench preprint and author-reported results
  2. Official ASI-Bench repository and public runner documentation
  3. AstaBench scientific-agent evaluation preprint
  4. Independent case study of autonomous scientific research frameworks