AI 新闻/研究NVIDIA AVO 的 100% ARC-AGI-3 结果测量的是工具链,而不是模型NVIDIA AVO 通过了 ARC-AGI-3 的公开集,但该基准没有隔离工具链的贡献,也没有在私有任务上测试泛化。
AI 新闻/政策与安全HarnessRisk 说明为什么一个提示词注入演示无法衡量代理安全性HarnessRisk 报告不同模型与代理 harness 组合之间存在广泛的安全差异,并发现配置阶段比其测试的其他生命周期阶段更脆弱。