Un estudio de 918 artículos cartografía el coste de reproducir la investigación en IA. Usa sus hallazgos para presupuestar código, datos, cómputo y tiempo de revisión.
WorldCup Arena prueba las previsiones de los LLM antes de que existan los resultados, pero la puntuación cambia la clasificación y el archivo público no incluye todas las llamadas originales al modelo.
ASI-Bench prueba agentes científicos mientras desaparece la orientación humana. Su mayor caída de puntuación revela un problema de construcción de procedimientos, no una prueba sobre la superinteligencia.
DeepMind inicia su investigación sobre agentes de EVE sin conexión. Así es como los mundos persistentes necesitan pruebas distintas para la memoria, la planificación, la recuperación y la seguridad.
AVO de NVIDIA superó el conjunto público de ARC-AGI-3, pero el benchmark no aísla la contribución del arnés ni prueba la generalización en tareas privadas.