ASI-Bench prueba agentes científicos mientras desaparece la orientación humana. Su mayor caída de puntuación revela un problema de construcción de procedimientos, no una prueba sobre la superinteligencia.
AVO de NVIDIA superó el conjunto público de ARC-AGI-3, pero el benchmark no aísla la contribución del arnés ni prueba la generalización en tareas privadas.
HarnessRisk informa de amplias diferencias de seguridad entre combinaciones de modelos y harnesses de agentes, y encuentra que la configuración es más vulnerable que las demás fases del ciclo de vida que probó.
Una mirada práctica a cómo las decisiones de evaluación influyen en las afirmaciones sobre modelos, las decisiones de producto y lo que los lectores deben revisar en los anuncios de IA.