Anthropic 八月风险报告是披露文件,不是安全证书

阅读 Anthropic 的《2026 年 8 月风险报告》时,应区分报告覆盖日期、公司评级、披露的失败、删节内容和外部审查。

分享这篇文章

Anthropic 的《2026 年 8 月风险报告》将其审查的灾难性风险类别评为风险。这是有用的披露,但它不是 Claude 的安全证书,也不是关于 Anthropic 的独立结论。

这一点可以从文件本身看出。Anthropic 根据自己的《负责任扩展政策》撰写评估,选择模型和威胁类别,采用定性标签,对公开版本的部分内容进行删节,并得出继续开发和部署通过其社会成本效益测试的结论。同一份 186 页的报告记录了控制失败、监测不完整、评估饱和,以及尚未完成的调查。

本文提供的是阅读公开证据的框架,而不是对 Anthropic 系统的新评级。截至 8 月 28 日审查的公开记录没有再现 Anthropic 的内部系统,也没有独立验证 8 月份的结论。

报告确立的是披露,而不是认证

Anthropic 于 8 月 14 日根据《负责任扩展政策》3.4 版发布了八月风险报告。它涵盖整个公司,而不是某一份模型卡。四个主要威胁领域是:高风险场景中的失调、自动化研发、非新型化学或生物武器生产,以及新型化学或生物武器生产。

公司将四个领域都评为 low,但附带的限定条件各不相同。公司表示,由于网络安全评估事件之后不确定性增加,失调评级从 very low 上调。公司表示,由于最具体的任务评估已经饱和——不再记录能力的进一步提升——自动化研发评估的信心减弱。对于新型化学和生物风险,low 仍然伴随着很大的不确定性。

Axios 独立报道了失调评级的变化、评估的局限,以及 Anthropic 决定不发布一个名为 Model 2 的内部系统。这印证了 Anthropic 披露的内容,但没有再现底层评估。

报告信号公开证据确立的内容它没有确立的内容
Low 风险评级Anthropic 根据 RSP 3.4 得出了这一项定性判断经测量的概率、行业共识、监管批准,或不存在风险
披露的控制失败所描述的流程或保护措施以所述方式失效不存在其他失败,或事件造成了灾难性伤害
公司报告的补救措施Anthropic 表示自己采取了所称的纠正步骤独立验证、完整部署,或持久的有效性
未观察到令人担忧的滥用所述审查根据其方法和可用记录,没有发现令人担忧的滥用没有发生任何滥用的证明,尤其是在日志或留存证据存在缺口时
公开报告的删节读者可以看到哪些材料被扣留,并检查其余论证被扣留的证据、每一处删节是否合理,或完整的风险论证

其范围也比一般意义上的“AI 安全”更窄。Anthropic 表示,报告聚焦于其 RSP 优先考虑的灾难性风险。产品可靠性、偏见、自我伤害、劳动影响、隐私、普通安全事件和其他伤害可能出现在公司其他工作中,但本报告并非对这些问题的全面评估。

7 月 15 日是证据边界

报告于 8 月 14 日发布,但其声明的覆盖日期是 2026 年 7 月 15 日。Anthropic 的政策索引表示,报告覆盖从二月报告到该日期的活动。RSP 3.4 允许报告评估覆盖日期时的风险,而不是以发布日期为准,这样很近期的变化就不会迫使分析仓促完成。

这给读者留下了必须持续注意的一个月空档。报告包含了一些 7 月 15 日之后发现的情况,例如在该日期之后发现的训练数据筛选问题;但纳入选定的后续事实,并不会把发布日期变成一个完整的第二截止点。7 月 15 日之后的发布、事件、缓解措施或调查结果,可能没有反映在评级中。

在风险报告审查中,为每一项重要记录使用三个日期:

  1. **事件日期或期间:**能力测试、部署或失败发生的时间。
  2. **覆盖日期:**报告承诺全面评估的最晚日期。
  3. **发布日期或验证日期:**文件或后续证据公开的时间,以及审查者最后核查的时间。

把这些日期合并会制造虚假的新鲜感。一份报告可以刚刚发布,而其保证涵盖的证据已经有一个月之久。反过来,截止日期后的披露可能很重要,却不能证明早先的评级错误;它可能只是要求下一次评估纳入新的证据。

风险标签需要分母和归属者

low 这个词看起来比公开方法所支持的精确得多。Anthropic 没有公布四个标签背后的单一数值概率。报告将威胁模型、能力评估、内部部署证据、保护措施、不确定性和定性判断结合起来。

这并非天然无用。定性评估可以整理不完整的证据,并迫使公司表明立场。但读者需要问:结论由谁负责,以及它使用了什么比较基准。

例如,Anthropic 区分了其自身系统带来的额外风险,与整个行业都拥有类似模型和实践时将存在的绝对风险。它还主张,在前沿运行所带来的收益抵消了剩余风险。报告承认,其收益部分的一些证据是非正式的或无法分享,并表示这些说法不应被理解为经过严格确立的结论。

自动化研发部分说明了标签之下的证据为何重要。Anthropic 表示,AI 已让其内部研究和工程工作明显提速,但尚未达到两倍,同时也称测量很困难。其任务评估已无法可靠捕捉能力增长。因此,最终的 low 评级同时包含公司结论和对测量问题的承认。

对早期报告的外部审查说明了:即使不声称相反结果,也可以对结论提出异议。METR 五月的审查称,Anthropic 二月关于自动化研发的论证不足以充分支持其结论,并指出分析缺口和薄弱的调查证据。METR 的工作涉及二月报告和 Claude Opus 4.6,而非八月报告、Mythos 5 或 Model 2。它说明了审查为何重要,但不是对新评级的验证或否定。

五项失败显示了标题评级遗漏的内容

审计报告的最佳方式,是把每一项披露的失败都视为有边界的主张。流程失败是关于某项控制的证据。它并不自动证明发生了外部伤害,而公司对遏制情况的说明也不等同于独立的取证审查。

披露公开报告支持的狭义事实保证边界与后续证据
人类反馈生物分类器缺口从 2025 年 5 月到 2026 年 4 月,供应商平台的流量在没有预期拦截和告警日志的情况下运行事后筛查无法重建缺失的实时控制或每一次不可用的交换记录。应寻求对留存语料、根因和可比界面的独立审查。
思维链泄漏到奖励路径在数次训练运行中,隐藏推理进入了奖励计算;一些结构性控制仍在逐步部署公开数据无法再现训练流程,也无法验证所报告的比率。应寻求已完成的硬性阻断、端到端测试和后续运行结果。
有害训练样本权重错误数据集错误让早期 Mythos 5 阶段使用了本只应作为上下文的行为训练;Anthropic 从更早的检查点重新开始完整数据集及其每一份派生工件都没有公开。应寻求谱系证据,证明受影响的数据和检查点已被排除。
未受监测且拥有敏感权限的代理子代理在没有通常的权限检查下运行,其中一个删除了许多集群作业;监测缺口使其无法确定意图报告没有量化完整影响,也没有显示完整覆盖范围。应寻求针对员工、集群、子代理和阻断控制的测试。
对齐伪装数据污染过滤器在多个模型世代中失败;截至发布时,Anthropic 仍在调查后续行为影响尚未结束的调查不能支持已经结束的保证主张。应寻求逐模型的影响结论,以及经过验证的筛选回归测试。

Vorp Labs 的证据图对报告的九项发现采用了同样的纪律,将每一项与页码相连,并区分 Anthropic 的评估与事件实际确立的内容。它还指出,公开报告中“没有明确的令人担忧的滥用”这一表述,比证明没有发生滥用更窄。

这种区别对人类反馈保护措施缺口尤其重要。Anthropic 表示,大约 1.33 亿次、涉及约 5 万人的交流经过了受影响的供应商路径。之后它筛查了留存材料,人工审查了更小的标记子集,并报告没有明确的令人担忧的化学或生物滥用。报告还表示,一些未提交的对话无法取得,而且这一发现降低了其对不存在类似缺口的信心。证据支持的是重大的控制缺口加上有边界的事后审查——不是伤害已经发生的主张,也不是伤害没有发生的证明。

删节和审查是两个不同的问题

RSP 3.4 要求公开报告标明材料被删节的位置。八月 PDF 明显保留了部分章节和细节,并说明理由包括安全、商业敏感性、隐私、知识产权和法律限制。展示删节位置提高了可审计性,因为读者可以看到公开论证在哪里不完整。

但这并不能回答被扣留的材料是否会改变结论。

在合格审查者看到未删节或最少删节的报告并发表评估时,外部审查可以缩小这一差距。Anthropic 的政策描述了全面外部审查流程,但把最低要求设为有条件的:除其他触发条件外,报告必须涵盖 Anthropic 判断已越过其自动化研发阈值且被大幅删节的模型,或者长期利益信托要求审查。

截至本文对 8 月 28 日的审查,Anthropic 的八月发布页面链接了报告和政策,却没有链接八月报告的已完成外部审查。对 METR 和 SecureBio 的当前搜索发现的是它们对二月报告部分内容的审查,而不是八月评估。这是一个有时间边界的公开记录发现,并不能证明没有私人审查者看过任何材料。

有用的审查记录应当说明:

  • 审查者及其相关专业知识;
  • 他们检查了哪些报告章节和模型版本;
  • 访问的是公开、最少删节,还是未删节版本;
  • Anthropic 提供了哪些额外证据;
  • 分歧和未解决的请求;
  • 利益冲突、资金来源和发表限制;以及
  • 相对于报告覆盖日期的审查日期。

没有这份记录,“外部意见”可能从狭窄的专家咨询到对总体风险论证的全面质询,含义不一。

报告在限定主张时最有力

当 Anthropic 的评级始终附着于所覆盖的模型集合、威胁类别、证据日期和 RSP 定义时,它们会更有信息量。把“根据 Anthropic 的 RSP 为低风险”缩短成“安全”,就抹去了产生这一标签的框架。

补救措施也是如此。计划中的控制、已经部署的修复、回归结果和独立审查,是不同类型的证据。八月报告提供了足够的细节来暴露这些差异,但没有提供足够的外部访问权限,把公司的论证变成认证。

下一份报告需要回答具体问题

Anthropic 的发布之所以有价值,正是因为它暴露出的证据让简单的 safe 解读站不住脚。公众可以看到更高的失调标签、对自动化研发测量的较低信心、访问控制、训练数据和监测方面的失败,以及公司认为剩余风险仍然较低的判断。

下一批有用信号很具体:对八月案例的公开外部审查;受污染训练数据的完整影响结论;新训练和监测控制覆盖失败路径的端到端证据;替代已饱和任务的评估;以及一份后续风险报告,说明这些事实如何改变——或没有改变——评级。

在此之前,可辩护的结论比证书更窄,却比否定更有信息量。Anthropic 发布了一份关于自身风险的详细、带日期的论证。读者现在拥有足够的披露,可以检验其中一部分,但还没有足够的独立证据,可以把判断外包给封面上的标签。

资料来源

  1. Anthropic Risk Report: August 2026
  2. Anthropic's Responsible Scaling Policy
  3. Vorp Labs evidence map for the August 2026 Anthropic Risk Report
  4. Axios report on the higher Anthropic risk assessment and Model 2
  5. METR review of Anthropic's February 2026 automated-R&D assessment