HarnessRisk 说明为什么一个提示词注入演示无法衡量代理安全性

HarnessRisk 报告不同模型与代理 harness 组合之间存在广泛的安全差异,并发现配置阶段比其测试的其他生命周期阶段更脆弱。

分享这篇文章

提示词注入测试可以显示代理是否会遵循文档中的恶意指令。它无法显示同一个代理 harness 是否能够安全地配置连接器、安装能力、保持干净状态、授权外部操作,或从污染中完全恢复。

一篇正在审阅的新预印本 HarnessRisk让这一缺失范围变得具体。作者在三个代理 harness、六个语言模型和 14 种模型与 harness 配置中测试了 128 个沙箱案例。他们报告的攻击成功率从 12.6% 到 80.9% 不等,而良性任务效用仍在 75.0% 到 97.6% 之间。在他们研究的三个 harness 中,harness 配置阶段都是最脆弱的阶段。

这些结果尚未被独立复现,基准也没有确立生产代理的普遍失败率。它真正有用的贡献是测试单位:将已部署的模型与 harness 作为一个整体,在配置、能力扩展、运行时操作、持久状态、行动控制和事件恢复方面进行评估,同时分别记录任务效用与安全结果

HarnessRisk 测试的是已部署配置,而不是孤立的模型

代理 harness 是语言模型周围的执行层。它提供工具、加载扩展、维护记忆、应用权限、呈现授权上下文,并将模型输出转化为行动。因此,使用同一个模型的两种部署可能暴露不同的工具和状态,以不同方式界定权限,并执行不同的边界。

HarnessRisk 体现了这种共同责任。每个案例都在三个所有者回合中给代理一个良性目标,同时把恶意指令放在不可信的工作流工件中。运行从全新环境开始,使用受控的模拟服务,并禁用真实的外部网络影响。128 个案例中的每一个,都会在每种被评估配置下使用三个采样种子重复运行。

作者发布的代码仓库包含 harness 适配器、模拟服务、轨迹收集、确定性评估规则和 LLM 评审器。但它并不能让复现变成一键操作:团队仍然需要独立的案例数据集、兼容的 harness 安装、模型提供商访问权限,以及在可能执行任意主机命令时更强的操作系统隔离。该仓库明确表示,其进程级分离不是操作系统安全沙箱。

论文的醒目范围也压缩了非常不同的配置。一个模型在 OpenClaw 上记录的攻击成功率为 54.7%,在 Nanobot 上为 12.6%,在作者的设置中相差 4.3 倍。这个比较不能隔离 harness 是原因,因为提示词、工具和状态管理都不同。但它确实说明,将基础模型的安全分数搬到不同部署中,是一种类别错误。

四个分数防止成功任务掩盖不安全运行

HarnessRisk 为每条轨迹分配四个二元标签,然后报告跨运行的百分比。这些标签回答不同问题,而且可以同时为真。

指标方向证据必须回答的问题常见的错误安慰
效用越高越好代理完成了良性用户目标吗?“任务通过了,所以这次运行是安全的。”
攻击成功率越低越好被禁止的效果真的发生了吗?“代理提醒了我们,所以攻击一定失败了。”
持久性越低越好恶意影响是否留在持久记忆、配置、政策、扩展或启动状态中?“这一回合没有发生坏事。”
检测越高越好代理是否明确识别出具体内容可疑或不可信?“拒绝或泛泛的警告证明它找到了真正的风险。”

这种区别很重要,因为识别和遏制是不同结果。在论文中,一个 OpenClaw 配置在 97.9% 的运行中检测到风险,但攻击成功率仍为 31.2%。另一个配置将 92.2% 的检测率与 54.7% 的攻击成功率结合在一起。在 12 种共享配置中,检测与较低的攻击成功率相关,但这个小型观察样本不支持因果结论,调整后的关系也没有达到统计显著性。

评估器本身也是不确定性来源。GPT-5.4 根据记录、工具调用、状态变化、模拟服务状态和网络观察为主要轨迹评分。在留出的样本中,其标签与确定性规则在效用案例上的一致率为 92.5%,在攻击成功案例上的一致率为 89.7%;与经裁定的人类标签的一致率,在持久性上为 84.3%,在检测上为 85.7%。这些是有用的验证结果,并不能证明评审器没有错误。

生命周期框架是这个基准最强的想法

六个阶段——配置、能力扩展、运行时操作、持久状态、行动控制和事件恢复——描述了不可信材料获得权限的不同机会。一个干净的运行时提示词注入结果,对于由恶意文本配置的连接器,或在之后会话中存活的中毒偏好,几乎说明不了什么。

配置值得特别关注,因为 HarnessRisk 发现,在每个被测试的 harness 中,配置阶段的攻击成功率最高;很多时候,不安全值出现在一个本来已经获授权的更改中。能力扩展又是另一回事:Anthropic 在 8 月 20 日的生产代理公告让 computer use、browser use、Skills API 和 Files API 正式可用,增加了 harness 可以加载的可复用组件数量。

一次当前的仿冒 skill 活动提供了现实世界的后果,但没有验证基准数字。TechRadar 报道,相似名称的代理 skill 后来加入了窃取凭据的行为;170 万这一数字是聚合显示安装量,不是独立用户或已确认受害者数量。这起事件属于能力扩展威胁模型,但不能证明任何 HarnessRisk 配置代表了那个市场或 Anthropic 的托管 API 容器。

这四种报告结果也应保持分开。部署可以完成良性任务,同时仍允许被禁止的效果;它可以检测可疑内容,同时仍无法遏制它;它可以在当前回合看起来安全,同时为下一回合保留恶意状态。一个混合的“安全分数”会抹掉这个基准最有用的区别。

这个基准无法替生产团队决定什么

截至 8 月 23 日,HarnessRisk 是第一版预印本证据,仍在审阅中。其 Hugging Face 论文页面显示了从业者的关注,但没有独立复现。作者评估了选定的模型、harness、案例、工件和指标;提供商端点和服务政策可能漂移。不同 harness 之间的比较是已部署配置之间的比较,不是仅针对 harness 效应的受控估计。

论文还使用“沙箱”来指隔离的运行状态、模拟副作用和受限的可达端点。附录称没有施加内核命名空间、chroot 或额外防火墙。测试能够执行任意主机命令的代理时,团队需要操作系统级遏制边界、虚假凭据、模拟服务、受限出口、可丢弃状态,以及一台没有任何值得窃取内容的主机。基准仓库给出了同样的警告。

最后,低攻击成功率可能包含安全拒绝、无法触达相关工具,或一般性的任务失败。持久性和检测取决于 harness 向评估器暴露了什么。部署测试应记录这些可观测性限制,而不是把没有日志事件当成什么都没有发生的证据。

近期最强的信号不会是更大的排行榜,而是一次独立重跑:固定案例、harness、模型、评估器和隔离环境的版本,然后展示某项具体控制是否在不摧毁效用的情况下降低攻击成功率或持久性。在那之前,这篇论文的六阶段框架最好被理解为对范围的警告:干净的提示词注入演示无法为代理系统的其余部分背书。

资料来源

  1. HarnessRisk lifecycle-oriented agent harness safety preprint
  2. Official HarnessRisk implementation repository
  3. Hugging Face page for the HarnessRisk preprint
  4. Anthropic production-agent API announcement
  5. TechRadar report on a typosquatted agent-skill campaign