El resultado del 100 % de AVO de NVIDIA en ARC-AGI-3 mide un arnés, no un modelo
AVO de NVIDIA superó el conjunto público de ARC-AGI-3, pero el benchmark no aísla la contribución del arnés ni prueba la generalización en tareas privadas.
NVIDIA informa de que su sistema Agentic Variation Operators, o AVO, combinado con Claude Opus 5 completó los 183 niveles de los 25 entornos públicos de ARC-AGI-3. La ejecución utilizó 6.624 acciones de entorno y obtuvo una puntuación de Relative Human Action Efficiency de 100,00. Es un resultado impresionante para el sistema de agente configurado.
No es una puntuación del 100 % para Claude Opus 5 por sí solo, una estimación controlada del beneficio de AVO ni evidencia de que el sistema generalice a las tareas privadas de ARC-AGI-3. NVIDIA señala cada uno de esos límites en su informe. La lección útil es más estrecha: la elección del modelo es solo una variable en una evaluación de agentes de horizonte largo, y un registro de benchmark debe identificar junto con la puntuación el arnés, la interfaz, el conjunto de tareas, el presupuesto y la métrica.
La puntuación pertenece a un sistema de extremo a extremo
Un arnés de agente es la capa operativa que rodea a un modelo. Decide qué observaciones entran en el contexto, qué herramientas y acciones están disponibles, cómo sobrevive la memoria entre pasos, cómo se detectan los fallos y cuándo un supervisor redirige el trabajo. Si se cambia esa capa, el mismo modelo puede comportarse como un sistema distinto.
Para su ejecución en el conjunto público, NVIDIA dice que AVO utilizó memoria persistente, un supervisor, herramientas y su propio bucle de ejecución. Claude Opus 5 recibió cada observación como una cuadrícula de texto exacta de 64×64, en lugar de la imagen renderizada de 512×512 utilizada por la configuración principal de VISTA. El agente recibió las acciones disponibles, pero no una descripción de las reglas o del objetivo de cada entorno.
Esos detalles forman parte del resultado, no son simples detalles de implementación. Una cuadrícula de texto cambia el problema de percepción. La memoria persistente cambia lo que el modelo puede reutilizar una vez que se llena su contexto inmediato. Un supervisor cambia la respuesta de la ejecución al estancamiento. Las descripciones de herramientas, la política de reintentos y el presupuesto de acciones cambian las rutas que el sistema puede explorar.
- ModeloClaude Opus 5 y su configuración de razonamiento
- Sistema de agenteMemoria, supervisor, herramientas, contexto y bucle de recuperación
- Interfaz y tareasObservaciones en cuadrícula de texto, acciones disponibles y conjunto público
- Registro de ejecuciónPuntuación RHAE, niveles completados, acciones, coste y fallos
- Observado
- El sistema integral configurado completó la ejecución del conjunto público.
- No aislado
- La contribución causal del modelo, la memoria, el supervisor o la interfaz.
- No medido
- La generalización a las tareas semiprivadas o totalmente privadas de ARC-AGI-3.
Por eso restar una puntuación titular de otra no revela “la contribución del arnés”. La cobertura independiente centró correctamente la atención en el arnés, pero su simplificación de que el modelo obtuvo alrededor del 30 % “sin el arnés” comprime condiciones materialmente diferentes en un solo interruptor. NVIDIA dice que la cifra inferior de ARC Prize utilizó una configuración de razonamiento y un sistema de agente y evaluación sustancialmente diferentes.
RHAE premia la finalización y la eficiencia de las acciones
ARC-AGI-3 presenta entornos interactivos parecidos a juegos sin instrucciones, reglas explícitas ni objetivos declarados. Un sistema debe explorar, inferir qué hacen sus acciones, descubrir el objetivo y completar niveles progresivamente más difíciles. El test pretende captar la adaptación mediante la interacción, no la precisión de las respuestas en un conjunto estático de preguntas.
El informe técnico de ARC Prize define Relative Human Action Efficiency, o RHAE, a partir del número de acciones que realiza un sistema en cada nivel completado comparado con una línea base humana de primer intento. La proporción se eleva al cuadrado, de modo que un agente que realiza diez veces más acciones que la línea base recibe un 1 % de crédito para ese nivel. Los niveles posteriores reciben más peso, los niveles incompletos limitan la puntuación del entorno y la puntuación final del benchmark se promedia entre entornos.
Por tanto, una puntuación RHAE de 100,00 registra un rendimiento completo y eficiente en acciones conforme a esa fórmula. No significa que cada acción coincidiera con la de una persona, que todas las hipótesis internas fueran correctas, que la ejecución fuera barata ni que el sistema alcanzara una “inteligencia general del 100 %”. NVIDIA comunica por separado los recuentos brutos de finalización y acciones para que la métrica pueda interpretarse y no solo repetirse.
La comparación entre sistemas con el mismo modelo más cercana en la publicación de NVIDIA es VISTA. Ambos sistemas configurados completaron los mismos 183 niveles públicos con Claude Opus 5. NVIDIA informa de 6.624 acciones de entorno para AVO y 7.542 para VISTA, aproximadamente un 12 % menos para AVO.
| Ejecución o referencia | Conjunto de tareas | Observación y límite del sistema | Resultado comunicado | Conclusión válida |
|---|---|---|---|---|
| AVO con Claude Opus 5 | 25 entornos públicos, 183 niveles | Observaciones en cuadrícula de texto; memoria, supervisor, herramientas y bucle de ejecución de AVO | 100,00 RHAE; 6.624 acciones | Este sistema configurado completó el conjunto público de forma eficiente |
| VISTA con Claude Opus 5 | Los mismos 183 niveles públicos | Backend, representación de observaciones, memoria, gestión del contexto e implementación diferentes | 7.542 acciones | AVO utilizó menos acciones en una comparación entre sistemas |
| Evaluación del modelo de ARC Prize citada por NVIDIA | Conjunto público | Misma familia de modelos, configuración de razonamiento y evaluación diferentes | Aproximadamente 30 % | La referencia a nivel de modelo no es una ablación de AVO |
NVIDIA dice explícitamente que la comparación AVO frente a VISTA no es una ablación controlada. La memoria pudo reducir la exploración repetida, pero el experimento no midió la memoria por separado. La diferencia del 12 % en acciones podría reflejar varios cambios que interactúan, por lo que debe impulsar pruebas más estrechas y no una afirmación causal.
Completar el conjunto público no es generalizar al conjunto privado
Aquí la palabra “público” tiene más peso que la palabra “perfecto”. ARC Prize diseñó los 25 entornos públicos como una demostración accesible del formato. Su informe dice que son deliberadamente más fáciles, hacen hincapié en la claridad y la participación y no representan exhaustivamente la mecánica del conjunto privado.
El conjunto de reserva real es mucho mayor: 55 entornos semiprivados para probar modelos detrás de API externas y 55 entornos completamente privados reservados para la competición. Esas tareas pretenden ser más difíciles y estar fuera de distribución con respecto a las demostraciones públicas. ARC Prize dice que no colocará los resultados del conjunto público en su tabla de clasificación oficial porque los equipos pueden inspeccionar o apuntar a esos entornos y porque el rendimiento público no es una medida válida del progreso hacia la inteligencia artificial general.
El informe de NVIDIA no afirma ningún resultado en ninguno de los dos conjuntos de reserva. Un análisis independiente del alcance llega a la misma conclusión práctica: mantener vinculados a la cifra el conjunto de tareas, la métrica, la configuración de razonamiento y las condiciones de ejecución. El resultado público puede demostrar un arnés capaz y dejar sin probar la generalización.
Eso no hace que la ejecución carezca de sentido. Completar 183 niveles interactivos con menos acciones que otro sistema configurado que tuvo éxito es una evidencia útil sobre ingeniería de sistemas. Simplemente responde a una pregunta distinta de la del benchmark privado oficial.
El resultado público no aísla la contribución de AVO
AVO y VISTA completaron los mismos 183 niveles públicos con Claude Opus 5, mientras AVO utilizó alrededor de un 12 % menos de acciones de entorno. La comparación es sugerente, pero el informe no mantiene fijas, una por una, la memoria, la supervisión, la recuperación, los prompts y todas las demás decisiones del arnés. El componente promocionado no puede heredar por tanto toda la mejora del sistema.
El conjunto público también sirvió como superficie de desarrollo que los equipos podían inspeccionar. Puede demostrar un sistema capaz de extremo a extremo, pero solo los entornos semiprivados y completamente privados pueden probar si ese sistema se transfiere más allá de las tareas disponibles durante el ajuste. Es el mismo problema de alcance que identifica el análisis de HarnessRisk (en español): la puntuación de un modelo no viaja de forma independiente de su arnés.
La próxima evidencia debe aislar el mecanismo
El seguimiento más sólido sería una ablación controlada de AVO que mantuviera fijos el modelo, la configuración de razonamiento, la interfaz de cuadrícula de texto, los entornos públicos y el presupuesto de acciones, y probara por separado la memoria, la supervisión y la recuperación. Una evaluación semiprivada o completamente privada respondería a otra pregunta: si el sistema se transfiere más allá de las tareas que sus diseñadores podían inspeccionar.
El coste y la latencia también deben situarse junto a la puntuación. Los sistemas de horizonte largo pueden intercambiar más llamadas al modelo, ejecuciones de herramientas, pasadas del supervisor o contexto almacenado por una mejor finalización. El informe público proporciona las acciones de entorno, pero no suficiente información para comparar el coste completo de servicio entre las configuraciones citadas.
Hasta que lleguen esos resultados, la ejecución de NVIDIA debe describirse con precisión y recibir crédito solo por lo que demuestra. AVO con Claude Opus 5 completó el conjunto público de ARC-AGI-3 con una puntuación RHAE de 100,00 y 6.624 acciones de entorno. Es evidencia de que el sistema circundante importa. También recuerda que la siguiente pregunta seria del benchmark no es “¿qué puntuación es mayor?”, sino “¿qué parte del sistema cambió y sobrevivió el resultado a un conjunto de reserva?”.