La API Claude Skills ya está disponible: los prompts reutilizables son un riesgo de cadena de suministro

Claude Skills puede agrupar instrucciones, scripts y dependencias. La disponibilidad general hace más importantes las versiones inmutables y los límites del entorno de ejecución.

Comparte este artículo

Anthropic hizo que su API de Skills estuviera disponible de forma general el 20 de agosto, convirtiendo una carpeta de instrucciones, scripts y plantillas en un componente versionado que los desarrolladores pueden adjuntar a las solicitudes de Claude API. Es una forma útil de empaquetado. También es una decisión sobre la cadena de suministro de software: el paquete puede influir en lo que lee un agente, el código que ejecuta, los datos que maneja y las demás capacidades que intenta utilizar.

El valor predeterminado seguro es tratar cada skill como material ejecutable, admitir una sola versión revisada cada vez y rechazar cualquier actualización que no pueda reproducir su procedencia, las capacidades solicitadas, la evidencia de pruebas y la vía de reversión. Un SKILL.md pulido, el número de descargas de un marketplace o una etiqueta de sandbox no bastan.

Un skill es a la vez una instrucción y material de ejecución

El anuncio de disponibilidad general de Anthropic define un skill como una carpeta que puede contener instrucciones, scripts y plantillas. Los desarrolladores suben y versionan skills personalizados y después los adjuntan a solicitudes que utilizan el entorno de ejecución de código.

Esa mezcla invalida un atajo de revisión habitual. Leer solo los archivos de código convencionales deja fuera las instrucciones en lenguaje natural que pueden redirigir al modelo. Leer solo SKILL.md deja fuera los scripts y archivos referenciados que se cargan después. Revisar una vez la carpeta de nivel superior deja fuera una dependencia mutable o una nueva versión subida después de la aprobación.

Dos artículos que aún no han sido revisados por pares muestran por qué importa el paquete completo. Una prepublicación de 2025 sobre inyección de prompts demuestra ataques ocultos en instrucciones largas de skills y scripts referenciados, incluido un caso probado en el que una aprobación previa para una tarea concreta se trasladó a una acción relacionada y dañina. Sus experimentos cubren agentes y configuraciones concretos, no todos los productos o despliegues, pero establecen que un archivo de instrucciones puede participar en una cadena de ejecución real.

Otra prepublicación empírica de gran escala recopiló 42.447 skills de dos marketplaces y analizó 31.132 con un escáner que combinaba análisis estático y un clasificador basado en un LLM. Los autores informan de que el 26,1% activó al menos uno de 14 patrones de vulnerabilidad y de que los skills con scripts ejecutables tenían 2,12 veces más probabilidades de ser señalados que los skills formados solo por instrucciones.

Ese resultado no significa que el 26,1% de los skills fueran maliciosos. El artículo informa de una precisión del 86,7% y una cobertura del 82,5% para su método de detección, mientras que solo el 5,2% de los skills analizados presentaba patrones de gravedad alta que los autores consideraban fuertemente indicativos de intención maliciosa. Los hallazgos automatizados mezclan casos hostiles, negligentes, ambiguos y mal clasificados. Son un motivo para revisar, no un veredicto.

«Sandbox» significa cosas distintas en cada superficie de Claude

La descripción general de Agent Skills documenta tres entornos distintos. Reducirlos a una única afirmación de seguridad produce una decisión de admisión equivocada.

Superficie Cómo se gestionan los skills personalizados Límite documentado de ejecución y uso compartido Consecuencia de admisión
Claude API Se suben mediante la Skills API y están disponibles en todo el espacio de trabajo El contenedor de ejecución de código no tiene acceso a la red ni permite instalar paquetes en tiempo de ejecución; se usa un contenedor nuevo salvo que la solicitud identifique uno existente Fija la versión exacta, separa los tenants por espacio de trabajo y revisa todas las demás herramientas y los datos subidos disponibles para la solicitud
Claude Code Skill del sistema de archivos bajo un directorio personal o de proyecto Se ejecuta en el ordenador del usuario con el acceso de red disponible para los programas locales Trata el sistema de archivos, el shell, las credenciales, la red y la instalación local de dependencias como permisos explícitos del equipo anfitrión
Claude.ai Se suben por usuario El acceso a la red varía según la configuración del usuario y del administrador; los skills personalizados no se comparten de forma centralizada en toda la organización Registra la política real de la cuenta y no heredes el modelo de amenazas de la API ni de Claude Code

La regla de ausencia de red del contenedor de la API es un límite duro significativo. Impide que un script de ese contenedor llame a una API externa y evita la instalación de paquetes en tiempo de ejecución. No hace que el paquete sea fiable. Una instrucción hostil aún puede corromper una salida, utilizar indebidamente archivos proporcionados deliberadamente al contenedor o dirigir al agente general hacia otra herramienta ya concedida. Revisa la solicitud completa del agente y el conjunto de herramientas, no el contenedor del skill de forma aislada.

El alcance del espacio de trabajo también importa. La guía de API de Anthropic afirma que cada clave de API de un espacio de trabajo puede leer, invocar y eliminar todos los skills personalizados que contiene. Recomienda un espacio de trabajo independiente para cada tenant en un servicio multiinquilino. Por tanto, un espacio de trabajo predeterminado compartido es un límite de autorización, no solo una etiqueta organizativa.

El incidente del marketplace también fue un fallo de control de versiones

Una campaña actual muestra por qué la reputación en el momento de la instalación no puede sustituir a una procedencia inmutable. TechRadar informó de que los atacantes clonaron skills legítimos con nombres parecidos, acumularon descargas y después introdujeron un comportamiento que robaba credenciales.

Zenity, la empresa de seguridad que descubrió la campaña y ayudó a interrumpirla, ofrece la cronología técnica. La familia maliciosa imitaba los proyectos Paperclip y Browser Use. Sus documentos de skills estaban inicialmente limpios; revisiones posteriores colocaron instrucciones dañinas en un archivo de configuración secundario que el skill principal solo cargaba durante la instalación. Zenity afirma que la familia superó 1,7 millones de instalaciones agregadas mostradas antes de ser retirada, y advierte que los contadores no eran ni usuarios únicos ni el número de víctimas.

El caso demuestra que hubo una campaña real, no que se vulnerara el sandbox de la API gestionada de Anthropic. Los skills afectados se dirigían a equipos de agentes y desarrolladores donde las instrucciones podían provocar la instalación de paquetes y el acceso a credenciales. La lección duradera es más limitada: los nombres, la popularidad y un escaneo limpio anterior no vinculan los bytes que se ejecutarán mañana.

La API de Anthropic ya ofrece el control necesario para evitar esa ambigüedad. Las actualizaciones de skills personalizados reciben identificadores de versión y cada versión es una instantánea completa. La guía de API recomienda explícitamente fijar una versión concreta en producción; seleccionar latest permite que una versión del espacio de trabajo recién subida cambie de inmediato el comportamiento desplegado.

La disponibilidad general convierte la identidad de versión en parte del límite de confianza

Un despliegue fiable debe vincular el código fuente revisado, el paquete completo y sus dependencias, la versión almacenada por Anthropic y la autoridad que el entorno de ejecución le concede. Revisar solo el archivo principal de instrucciones deja fuera los archivos secundarios de configuración y los scripts; fijar solo un commit del repositorio deja fuera una instantánea de Platform subida por separado. Usar latest deliberadamente renuncia a ese vínculo.

La contención en tiempo de ejecución y la revisión del artefacto resuelven problemas distintos. El límite de ausencia de red del contenedor de la API restringe a qué puede llegar el código ejecutado, pero no demuestra que una instrucción sea benigna ni que el agente general no vaya a utilizar indebidamente otra herramienta concedida. A la inversa, una revisión limpia del código fuente no hace seguro un espacio de trabajo con permisos excesivos. La campaña del marketplace importa porque combinó distribución mutable, señales de reputación y cambios maliciosos diferidos: las condiciones exactas que una versión inmutable pretende separar.

El mismo límite aparece en la investigación de Snowflake GitHub Actions: el texto se volvió peligroso cuando un sistema privilegiado lo trató como código. El análisis de Slack Code sigue esa cadena más allá de un agente, hasta los controles del repositorio, la CI y el despliegue.

La aprobación caduca cuando se mueve cualquier límite material

Cualquier decisión de confianza cubre un paquete, una versión, una superficie de ejecución y un conjunto de capacidades. Un cambio en una instrucción, un archivo referenciado, una dependencia, un permiso, una clase de datos, una herramienta externa, una política del entorno de ejecución o el límite del espacio de trabajo crea un sistema materialmente distinto. Incluso un paquete sin cambios puede volverse más arriesgado si su fuente desaparece o cambia de propietario.

La nota de ingeniería de Anthropic sobre la contención deja clara la razón más amplia: un recurso de agente externo crea tanto riesgo convencional de ejecución de código como riesgo de inyección de prompts. La revisión del código fuente y la fijación de versión resuelven parte del primero. No demuestran cómo interpretará el modelo cada instrucción. El sandbox limita las consecuencias, pero las defensas a nivel de modelo son probabilísticas y no pueden sustituir a los límites del entorno.

La disponibilidad general facilita operar con skills reutilizados. La pregunta de producción ya no es si un equipo puede subir una carpeta. Es si puede demostrar qué carpeta se ejecutó, qué autoridad recibió, qué ocurrió durante la prueba y con qué rapidez puede retirarse esa autoridad cuando la siguiente versión no sea la aprobada.

Fuentes

  1. Anthropic announcement for the generally available Skills API
  2. Claude Platform Agent Skills overview
  3. Claude Platform guide to using and versioning API skills
  4. Anthropic engineering note on containing agents and external resources
  5. Agent Skills prompt-injection preprint
  6. Agent Skills in the Wild empirical security preprint
  7. TechRadar report on a typosquatted skill campaign
  8. Zenity Labs technical report on the skill supply-chain campaign