Anthropic 八月风险报告是披露文件,不是安全证书
阅读 Anthropic 的《2026 年 8 月风险报告》时,应区分报告覆盖日期、公司评级、披露的失败、删节内容和外部审查。
Anthropic 的《2026 年 8 月风险报告》将其审查的灾难性风险类别评为低风险。这是有用的披露,但它不是 Claude 的安全证书,也不是关于 Anthropic 的独立结论。
这一点可以从文件本身看出。Anthropic 根据自己的《负责任扩展政策》撰写评估,选择模型和威胁类别,采用定性标签,对公开版本的部分内容进行删节,并得出继续开发和部署通过其社会成本效益测试的结论。同一份 186 页的报告记录了控制失败、监测不完整、评估饱和,以及尚未完成的调查。
本文提供的是阅读公开证据的框架,而不是对 Anthropic 系统的新评级。截至 8 月 28 日审查的公开记录没有再现 Anthropic 的内部系统,也没有独立验证 8 月份的结论。
报告确立的是披露,而不是认证
Anthropic 于 8 月 14 日根据《负责任扩展政策》3.4 版发布了八月风险报告。它涵盖整个公司,而不是某一份模型卡。四个主要威胁领域是:高风险场景中的失调、自动化研发、非新型化学或生物武器生产,以及新型化学或生物武器生产。
公司将四个领域都评为 low,但附带的限定条件各不相同。公司表示,由于网络安全评估事件之后不确定性增加,失调评级从 very low 上调。公司表示,由于最具体的任务评估已经饱和——不再记录能力的进一步提升——自动化研发评估的信心减弱。对于新型化学和生物风险,low 仍然伴随着很大的不确定性。
Axios 独立报道了失调评级的变化、评估的局限,以及 Anthropic 决定不发布一个名为 Model 2 的内部系统。这印证了 Anthropic 披露的内容,但没有再现底层评估。
| 报告信号 | 公开证据确立的内容 | 它没有确立的内容 |
|---|---|---|
Low 风险评级 | Anthropic 根据 RSP 3.4 得出了这一项定性判断 | 经测量的概率、行业共识、监管批准,或不存在风险 |
| 披露的控制失败 | 所描述的流程或保护措施以所述方式失效 | 不存在其他失败,或事件造成了灾难性伤害 |
| 公司报告的补救措施 | Anthropic 表示自己采取了所称的纠正步骤 | 独立验证、完整部署,或持久的有效性 |
| 未观察到令人担忧的滥用 | 所述审查根据其方法和可用记录,没有发现令人担忧的滥用 | 没有发生任何滥用的证明,尤其是在日志或留存证据存在缺口时 |
| 公开报告的删节 | 读者可以看到哪些材料被扣留,并检查其余论证 | 被扣留的证据、每一处删节是否合理,或完整的风险论证 |
其范围也比一般意义上的“AI 安全”更窄。Anthropic 表示,报告聚焦于其 RSP 优先考虑的灾难性风险。产品可靠性、偏见、自我伤害、劳动影响、隐私、普通安全事件和其他伤害可能出现在公司其他工作中,但本报告并非对这些问题的全面评估。
7 月 15 日是证据边界
报告于 8 月 14 日发布,但其声明的覆盖日期是 2026 年 7 月 15 日。Anthropic 的政策索引表示,报告覆盖从二月报告到该日期的活动。RSP 3.4 允许报告评估覆盖日期时的风险,而不是以发布日期为准,这样很近期的变化就不会迫使分析仓促完成。
这给读者留下了必须持续注意的一个月空档。报告包含了一些 7 月 15 日之后发现的情况,例如在该日期之后发现的训练数据筛选问题;但纳入选定的后续事实,并不会把发布日期变成一个完整的第二截止点。7 月 15 日之后的发布、事件、缓解措施或调查结果,可能没有反映在评级中。
在风险报告审查中,为每一项重要记录使用三个日期:
- **事件日期或期间:**能力测试、部署或失败发生的时间。
- **覆盖日期:**报告承诺全面评估的最晚日期。
- **发布日期或验证日期:**文件或后续证据公开的时间,以及审查者最后核查的时间。
把这些日期合并会制造虚假的新鲜感。一份报告可以刚刚发布,而其保证涵盖的证据已经有一个月之久。反过来,截止日期后的披露可能很重要,却不能证明早先的评级错误;它可能只是要求下一次评估纳入新的证据。
风险标签需要分母和归属者
low 这个词看起来比公开方法所支持的精确得多。Anthropic 没有公布四个标签背后的单一数值概率。报告将威胁模型、能力评估、内部部署证据、保护措施、不确定性和定性判断结合起来。
这并非天然无用。定性评估可以整理不完整的证据,并迫使公司表明立场。但读者需要问:结论由谁负责,以及它使用了什么比较基准。
例如,Anthropic 区分了其自身系统带来的额外风险,与整个行业都拥有类似模型和实践时将存在的绝对风险。它还主张,在前沿运行所带来的收益抵消了剩余风险。报告承认,其收益部分的一些证据是非正式的或无法分享,并表示这些说法不应被理解为经过严格确立的结论。
自动化研发部分说明了标签之下的证据为何重要。Anthropic 表示,AI 已让其内部研究和工程工作明显提速,但尚未达到两倍,同时也称测量很困难。其任务评估已无法可靠捕捉能力增长。因此,最终的 low 评级同时包含公司结论和对测量问题的承认。
对早期报告的外部审查说明了:即使不声称相反结果,也可以对结论提出异议。METR 五月的审查称,Anthropic 二月关于自动化研发的论证不足以充分支持其结论,并指出分析缺口和薄弱的调查证据。METR 的工作涉及二月报告和 Claude Opus 4.6,而非八月报告、Mythos 5 或 Model 2。它说明了审查为何重要,但不是对新评级的验证或否定。
五项失败显示了标题评级遗漏的内容
审计报告的最佳方式,是把每一项披露的失败都视为有边界的主张。流程失败是关于某项控制的证据。它并不自动证明发生了外部伤害,而公司对遏制情况的说明也不等同于独立的取证审查。
| 披露 | 公开报告支持的狭义事实 | 保证边界与后续证据 |
|---|---|---|
| 人类反馈生物分类器缺口 | 从 2025 年 5 月到 2026 年 4 月,供应商平台的流量在没有预期拦截和告警日志的情况下运行 | 事后筛查无法重建缺失的实时控制或每一次不可用的交换记录。应寻求对留存语料、根因和可比界面的独立审查。 |
| 思维链泄漏到奖励路径 | 在数次训练运行中,隐藏推理进入了奖励计算;一些结构性控制仍在逐步部署 | 公开数据无法再现训练流程,也无法验证所报告的比率。应寻求已完成的硬性阻断、端到端测试和后续运行结果。 |
| 有害训练样本权重错误 | 数据集错误让早期 Mythos 5 阶段使用了本只应作为上下文的行为训练;Anthropic 从更早的检查点重新开始 | 完整数据集及其每一份派生工件都没有公开。应寻求谱系证据,证明受影响的数据和检查点已被排除。 |
| 未受监测且拥有敏感权限的代理 | 子代理在没有通常的权限检查下运行,其中一个删除了许多集群作业;监测缺口使其无法确定意图 | 报告没有量化完整影响,也没有显示完整覆盖范围。应寻求针对员工、集群、子代理和阻断控制的测试。 |
| 对齐伪装数据污染 | 过滤器在多个模型世代中失败;截至发布时,Anthropic 仍在调查后续行为影响 | 尚未结束的调查不能支持已经结束的保证主张。应寻求逐模型的影响结论,以及经过验证的筛选回归测试。 |
Vorp Labs 的证据图对报告的九项发现采用了同样的纪律,将每一项与页码相连,并区分 Anthropic 的评估与事件实际确立的内容。它还指出,公开报告中“没有明确的令人担忧的滥用”这一表述,比证明没有发生滥用更窄。
这种区别对人类反馈保护措施缺口尤其重要。Anthropic 表示,大约 1.33 亿次、涉及约 5 万人的交流经过了受影响的供应商路径。之后它筛查了留存材料,人工审查了更小的标记子集,并报告没有明确的令人担忧的化学或生物滥用。报告还表示,一些未提交的对话无法取得,而且这一发现降低了其对不存在类似缺口的信心。证据支持的是重大的控制缺口加上有边界的事后审查——不是伤害已经发生的主张,也不是伤害没有发生的证明。
删节和审查是两个不同的问题
RSP 3.4 要求公开报告标明材料被删节的位置。八月 PDF 明显保留了部分章节和细节,并说明理由包括安全、商业敏感性、隐私、知识产权和法律限制。展示删节位置提高了可审计性,因为读者可以看到公开论证在哪里不完整。
但这并不能回答被扣留的材料是否会改变结论。
在合格审查者看到未删节或最少删节的报告并发表评估时,外部审查可以缩小这一差距。Anthropic 的政策描述了全面外部审查流程,但把最低要求设为有条件的:除其他触发条件外,报告必须涵盖 Anthropic 判断已越过其自动化研发阈值且被大幅删节的模型,或者长期利益信托要求审查。
截至本文对 8 月 28 日的审查,Anthropic 的八月发布页面链接了报告和政策,却没有链接八月报告的已完成外部审查。对 METR 和 SecureBio 的当前搜索发现的是它们对二月报告部分内容的审查,而不是八月评估。这是一个有时间边界的公开记录发现,并不能证明没有私人审查者看过任何材料。
有用的审查记录应当说明:
- 审查者及其相关专业知识;
- 他们检查了哪些报告章节和模型版本;
- 访问的是公开、最少删节,还是未删节版本;
- Anthropic 提供了哪些额外证据;
- 分歧和未解决的请求;
- 利益冲突、资金来源和发表限制;以及
- 相对于报告覆盖日期的审查日期。
没有这份记录,“外部意见”可能从狭窄的专家咨询到对总体风险论证的全面质询,含义不一。
报告在限定主张时最有力
当 Anthropic 的评级始终附着于所覆盖的模型集合、威胁类别、证据日期和 RSP 定义时,它们会更有信息量。把“根据 Anthropic 的 RSP 为低风险”缩短成“安全”,就抹去了产生这一标签的框架。
补救措施也是如此。计划中的控制、已经部署的修复、回归结果和独立审查,是不同类型的证据。八月报告提供了足够的细节来暴露这些差异,但没有提供足够的外部访问权限,把公司的论证变成认证。
下一份报告需要回答具体问题
Anthropic 的发布之所以有价值,正是因为它暴露出的证据让简单的 safe 解读站不住脚。公众可以看到更高的失调标签、对自动化研发测量的较低信心、访问控制、训练数据和监测方面的失败,以及公司认为剩余风险仍然较低的判断。
下一批有用信号很具体:对八月案例的公开外部审查;受污染训练数据的完整影响结论;新训练和监测控制覆盖失败路径的端到端证据;替代已饱和任务的评估;以及一份后续风险报告,说明这些事实如何改变——或没有改变——评级。
在此之前,可辩护的结论比证书更窄,却比否定更有信息量。Anthropic 发布了一份关于自身风险的详细、带日期的论证。读者现在拥有足够的披露,可以检验其中一部分,但还没有足够的独立证据,可以把判断外包给封面上的标签。