El informe de riesgos de Anthropic de agosto es una divulgación, no un certificado de seguridad

Lea el Risk Report de Anthropic de agosto de 2026 separando su fecha de cobertura, las calificaciones de la empresa, los fallos divulgados, las redacciones y la revisión externa.

Comparte este artículo

El Risk Report de Anthropic de agosto de 2026 asigna un riesgo low a las categorías de riesgo catastrófico que examina. Es una divulgación útil, pero no un certificado de seguridad para Claude ni un hallazgo independiente sobre Anthropic.

La distinción se desprende del propio documento. Anthropic redactó la evaluación conforme a su propia Responsible Scaling Policy, eligió los modelos y las categorías de amenaza, aplicó etiquetas cualitativas, ocultó partes de la versión pública y concluyó que el desarrollo y el despliegue continuados superaban su prueba de coste-beneficio social. El mismo informe de 186 páginas registra fallos de control, monitorización incompleta, evaluaciones saturadas e investigaciones que aún no habían terminado.

Este es un marco para leer la evidencia pública, no una nueva calificación de los sistemas de Anthropic. El registro público revisado hasta el 28 de agosto no reproduce los sistemas internos de Anthropic ni valida de forma independiente las conclusiones de agosto.

El informe establece divulgaciones, no una certificación

Anthropic publicó el August Risk Report el 14 de agosto conforme a la versión 3.4 de la Responsible Scaling Policy. Abarca la empresa en su conjunto, no una model card concreta. Las cuatro áreas principales de amenaza son la desalineación en contextos de alto riesgo, la investigación y el desarrollo automatizados, la producción de armas químicas o biológicas no novedosas y la producción de armas químicas o biológicas novedosas.

La empresa califica las cuatro áreas como low, con distintas salvedades. Dice que la calificación de desalineación aumentó desde very low por una mayor incertidumbre tras incidentes en las evaluaciones de ciberseguridad. Dice que su confianza en la evaluación de investigación y desarrollo automatizados se debilitó porque sus evaluaciones de tareas más concretas se saturaron: ya no registraban nuevos aumentos de capacidad. Para los riesgos químicos y biológicos novedosos, low sigue conllevando una incertidumbre considerable.

Axios informó de manera independiente sobre el cambio en la calificación de desalineación, la limitación de la evaluación y la decisión de Anthropic de no publicar un sistema interno llamado Model 2. Eso corrobora lo que Anthropic divulgó, pero no reproduce las evaluaciones subyacentes.

Señal del informeLo que establece la evidencia públicaLo que no establece
Calificación de riesgo LowAnthropic llegó a ese juicio cualitativo conforme a la RSP 3.4Una probabilidad medida, un consenso del sector, la aprobación de un regulador o la ausencia de riesgo
Fallo de control divulgadoEl proceso o la salvaguarda descritos fallaron de la manera indicadaQue no existiera ningún otro fallo o que el incidente causara un daño catastrófico
Medida correctiva comunicada por la empresaAnthropic afirma haber tomado el paso correctivo mencionadoVerificación independiente, despliegue completo o eficacia duradera
No se observó un uso indebido preocupanteLa revisión indicada no identificó un uso indebido preocupante según sus métodos y los registros disponiblesPrueba de que no ocurrió ningún uso indebido, especialmente cuando faltan registros o evidencias conservadas
Informe público redactadoLos lectores pueden ver dónde se retuvo material e inspeccionar el argumento restanteLa evidencia retenida, la razonabilidad de cada redacción o el caso de riesgo completo

El alcance también es más estrecho que la “seguridad de la IA” en general. Anthropic dice que el informe se centra en los riesgos catastróficos priorizados por su RSP. La fiabilidad del producto, los sesgos, las autolesiones, los efectos laborales, la privacidad, los incidentes de seguridad ordinarios y otros daños pueden aparecer en otros trabajos de la empresa, pero este informe no es una evaluación exhaustiva de ellos.

El 15 de julio es el límite de la evidencia

El informe se publicó el 14 de agosto, pero su fecha de cobertura declarada es el 15 de julio de 2026. El índice de políticas de Anthropic dice que el informe cubre la actividad desde el informe de febrero hasta esa fecha. La RSP 3.4 permite evaluar el riesgo a fecha de cobertura en lugar de a fecha de publicación, para que los cambios muy recientes no obliguen a realizar un análisis apresurado.

Esto crea una brecha de un mes que los lectores deben mantener visible. El informe incluye algunos descubrimientos posteriores, como un problema de filtrado de datos de entrenamiento encontrado después del 15 de julio, pero incluir hechos posteriores seleccionados no convierte el día de publicación en un segundo corte completo. Un lanzamiento, incidente, mitigación o resultado de investigación posterior al 15 de julio puede no estar reflejado en las calificaciones.

Use tres fechas para cada fila relevante en una revisión de un informe de riesgos:

  1. Fecha o periodo del evento: cuándo tuvo lugar la prueba de capacidad, el despliegue o el fallo.
  2. Fecha de cobertura: la fecha más reciente que el informe promete evaluar de forma exhaustiva.
  3. Fecha de publicación o verificación: cuándo se hicieron públicos el documento o las evidencias posteriores y cuándo las comprobó por última vez el revisor.

Colapsar esas fechas produce una falsa sensación de actualidad. Un informe puede ser de publicación reciente mientras la evidencia que garantiza cubrir ya tiene un mes. A la inversa, una divulgación posterior al corte puede ser importante sin demostrar que la calificación anterior fuera errónea; quizá simplemente exija que la próxima evaluación tenga en cuenta nuevas evidencias.

Una etiqueta de riesgo necesita su denominador y un responsable

La palabra low parece más precisa de lo que permite el método público. Anthropic no publica una probabilidad numérica única detrás de las cuatro etiquetas. En cambio, el informe combina modelos de amenazas, evaluaciones de capacidades, evidencia interna de despliegue, salvaguardas, incertidumbre y juicio cualitativo.

Eso no es necesariamente inútil. Una evaluación cualitativa puede organizar evidencia incompleta y obligar a una empresa a declarar una posición. Pero los lectores deben preguntar quién es responsable de la conclusión y con qué comparación se formula.

Por ejemplo, Anthropic distingue el riesgo adicional creado por sus propios sistemas del riesgo absoluto que existiría si el conjunto del sector tuviera modelos y prácticas similares. También sostiene que los beneficios de operar en la frontera compensan los riesgos restantes. El informe reconoce que parte de la evidencia de su sección de beneficios es informal o no puede compartirse, y dice que esas afirmaciones no deben leerse como conclusiones rigurosamente establecidas.

La sección sobre investigación y desarrollo automatizados muestra por qué importa la evidencia que hay bajo la etiqueta. Anthropic dice que la IA ha acelerado significativamente su investigación y su ingeniería internas, aunque todavía no las ha duplicado, y también califica de difícil la medición. Sus evaluaciones de tareas ya no captan el crecimiento de capacidades de forma fiable. Por tanto, la calificación low resultante contiene tanto una conclusión de la empresa como un reconocimiento de un problema de medición.

Una revisión externa de un informe anterior demuestra que las conclusiones pueden ser discutidas sin afirmar el resultado contrario. La revisión de METR de mayo dijo que el argumento de Anthropic sobre investigación y desarrollo automatizados en febrero no respaldaba adecuadamente su conclusión, y señaló lagunas analíticas y evidencia débil de encuestas. El trabajo de METR se refería al informe de febrero y a Claude Opus 4.6, no al informe de agosto, Mythos 5 o Model 2. Es un contexto que explica por qué importa la revisión, no una validación o un rechazo de la nueva calificación.

Cinco fallos muestran lo que omite el titular de la calificación

La forma más sólida de auditar el informe es leer cada fallo divulgado como una afirmación acotada. Un fallo de proceso es evidencia sobre un control. No demuestra automáticamente un daño externo, y la explicación de la empresa sobre la contención no equivale a una revisión forense independiente.

DivulgaciónHecho limitado respaldado por el informe públicoLímite de la garantía y evidencia de seguimiento
Brecha en el clasificador biológico basado en feedback humanoEl tráfico de la plataforma del proveedor funcionó sin el bloqueo y el registro de alertas previstos entre mayo de 2025 y abril de 2026El cribado retrospectivo no puede reconstruir los controles en tiempo real que faltaron ni todos los intercambios no disponibles. Hay que pedir una revisión independiente del corpus conservado, la causa raíz y superficies comparables.
Filtración de la cadena de pensamiento hacia las rutas de recompensaEl razonamiento oculto llegó a los cálculos de recompensa en varias ejecuciones de entrenamiento; algunos controles estructurales aún se estaban desplegandoLos datos públicos no reproducen el pipeline de entrenamiento ni verifican las tasas comunicadas. Hay que pedir bloqueos estrictos completados, pruebas de extremo a extremo y resultados de ejecuciones posteriores.
Ponderación incorrecta de ejemplos de entrenamiento dañinosUn error del conjunto de datos entrenó una fase temprana de Mythos 5 con un comportamiento destinado solo a servir de contexto; Anthropic reinició desde un checkpoint anteriorEl conjunto de datos completo y cada artefacto derivado no son públicos. Hay que pedir evidencia de trazabilidad que demuestre que los datos y checkpoints afectados se excluyeron.
Agentes sin monitorización con acceso sensibleLos subagentes funcionaron sin las comprobaciones normales de permisos y uno eliminó muchos trabajos del clúster; la brecha de monitorización impidió establecer firmemente la intenciónEl informe no cuantifica todo el impacto ni muestra una cobertura completa. Hay que pedir pruebas en empleados, clústeres, subagentes y controles de bloqueo.
Contaminación de datos por simulación de alineamientoLos filtros fallaron en varias generaciones de modelos; Anthropic aún investigaba los efectos conductuales posteriores cuando se publicó el informeUna investigación abierta no puede respaldar una afirmación de garantía cerrada. Hay que pedir conclusiones de impacto por modelo y una prueba de regresión del filtrado verificada.

El mapa de evidencia de Vorp Labs aplica la misma disciplina a nueve hallazgos del informe, vincula cada uno con una página y separa la evaluación de Anthropic de lo que establece el incidente. También señala que la expresión del informe público “no se observó un uso indebido preocupante claro” es más estrecha que demostrar que no ocurrió ningún uso indebido.

Esa distinción es especialmente importante para la brecha de la salvaguarda basada en feedback humano. Anthropic dice que unos 133 millones de intercambios en los que participaron unas 50.000 personas pasaron por la ruta del proveedor afectada. Después examinó el material conservado, revisó manualmente un subconjunto más pequeño que había sido señalado e informó de que no había encontrado un uso indebido químico o biológico claramente preocupante. El informe también dice que algunas conversaciones no enviadas no estaban disponibles y que el descubrimiento redujo la confianza en que no quedara una brecha similar. La evidencia respalda una brecha de control importante y una revisión retrospectiva acotada: no que se produjera un daño, ni que demuestre que no se produjo.

Las redacciones y la revisión son preguntas distintas

La RSP 3.4 exige que los informes públicos indiquen dónde se redactó material. El PDF de agosto oculta visiblemente secciones y detalles por razones declaradas que incluyen la seguridad, la sensibilidad comercial, la privacidad, la propiedad intelectual y las limitaciones legales. Mostrar la ubicación de una redacción mejora la auditabilidad porque los lectores pueden ver dónde está incompleto el argumento público.

No responde si el material retenido cambiaría la conclusión.

La revisión externa podría estrechar esa brecha si un revisor cualificado ve un informe sin redacciones o con redacciones mínimas y publica una evaluación. La política de Anthropic describe un proceso de revisión externa exhaustivo, pero condiciona el requisito mínimo: entre otros factores desencadenantes, un informe debe cubrir un modelo que Anthropic considere que ha superado su umbral de investigación y desarrollo automatizados y que esté significativamente redactado, o el Long-Term Benefit Trust debe solicitar la revisión.

La página de publicación de Anthropic de agosto enlaza el informe y la política, pero a fecha de la revisión del 28 de agosto para este artículo no enlaza una revisión externa completada del informe de agosto. Las búsquedas actuales de METR y SecureBio mostraron sus revisiones de partes del informe de febrero, no la evaluación de agosto. Es un hallazgo del registro público con un límite temporal, no una prueba de que ningún revisor privado haya visto material alguno.

Un registro de revisión útil debería indicar:

  • el revisor y sus conocimientos pertinentes;
  • qué secciones del informe y versiones de modelos examinó;
  • si el acceso fue público, con redacciones mínimas o sin redacciones;
  • qué evidencia adicional proporcionó Anthropic;
  • desacuerdos y solicitudes pendientes;
  • conflictos, financiación y límites de publicación; y
  • la fecha de revisión con respecto a la fecha de cobertura del informe.

Sin ese registro, “aportación externa” puede significar desde una consulta limitada a un especialista hasta un cuestionamiento exhaustivo del caso de riesgo general.

El informe es más sólido cuando sus afirmaciones permanecen acotadas

Las calificaciones de Anthropic son más informativas cuando siguen vinculadas al conjunto de modelos cubierto, la categoría de amenaza, la fecha de la evidencia y la definición de la RSP. Acortar “riesgo low según la RSP de Anthropic” a “seguro” borra el marco que produjo la etiqueta.

Lo mismo se aplica a las medidas correctivas. Un control planificado, una solución desplegada, un resultado de regresión y una revisión independiente son tipos de evidencia distintos. El informe de agosto contiene suficientes detalles para exponer esas diferencias, pero no suficiente acceso externo para convertir el argumento de la empresa en una certificación.

El próximo informe tiene preguntas concretas que cerrar

La publicación de Anthropic es valiosa precisamente porque expone evidencias que hacen insostenible una lectura simple de safe. El público puede ver una etiqueta de desalineación más alta, menor confianza en la medición de la investigación y el desarrollo automatizados, fallos en el control de acceso, los datos de entrenamiento y la monitorización, y el juicio de la empresa de que el riesgo restante sigue siendo bajo.

Las próximas señales útiles son concretas: una revisión externa pública del caso de agosto; conclusiones completas sobre el impacto de los datos de entrenamiento contaminados; evidencia de extremo a extremo de que los nuevos controles de entrenamiento y monitorización cubren las rutas que fallaron; evaluaciones que sustituyan las tareas saturadas; y un Risk Report posterior que indique cómo esos hechos cambiaron —o no cambiaron— las calificaciones.

Hasta entonces, la conclusión defendible es más estrecha que un certificado y más informativa que el rechazo. Anthropic ha publicado un argumento detallado y fechado sobre su propio riesgo. Los lectores tienen ahora suficiente divulgación para poner a prueba partes de ese argumento, pero no suficiente evidencia independiente para delegar el juicio en la etiqueta de su portada.

Fuentes

  1. Anthropic Risk Report: August 2026
  2. Anthropic's Responsible Scaling Policy
  3. Vorp Labs evidence map for the August 2026 Anthropic Risk Report
  4. Axios report on the higher Anthropic risk assessment and Model 2
  5. METR review of Anthropic's February 2026 automated-R&D assessment