El reciente lanzamiento de Claude Cowork, la nueva herramienta de agentes de IA de Anthropic, se ha visto empañado por la aparición de una vulnerabilidad de seguridad que permite la exfiltración de archivos locales mediante ataques de prompt injection. El problema fue detectado apenas unos días después de que el producto estuviera disponible en vista previa, lo que ha reabierto el debate sobre los riesgos de los agentes autónomos con acceso a sistemas de archivos.
Claude Cowork fue presentado como una solución diseñada para automatizar tareas de oficina, gestionar documentos y ejecutar flujos de trabajo complejos de forma sencilla, incluso para usuarios sin conocimientos técnicos avanzados. Sin embargo, investigadores de seguridad han demostrado que un atacante puede ocultar instrucciones maliciosas dentro de documentos aparentemente inofensivos, como archivos de texto o documentos Word, que el agente interpreta y ejecuta sin que el usuario sea consciente.
El ataque se basa en una técnica conocida como inyección indirecta de prompts, en la que el modelo recibe órdenes camufladas en el contenido que analiza. En este caso, dichas instrucciones pueden forzar a Claude Cowork a leer otros archivos locales, comprimirlos y enviarlos a un destino externo utilizando servicios legítimos integrados en el propio ecosistema de Anthropic. Todo esto ocurre una vez que el usuario ha concedido acceso a una carpeta, sin nuevas advertencias claras durante el proceso.
Lo más preocupante para la comunidad de ciberseguridad es que este vector de ataque no es completamente nuevo. Investigadores independientes ya habían alertado en 2025 sobre fallos similares en otras herramientas de Anthropic, donde los modelos con capacidad de acción podían ser manipulados para acceder a información sensible. Según los expertos, el hecho de que el problema reaparezca en Cowork sugiere que las defensas actuales contra la prompt injection siguen siendo insuficientes cuando los modelos interactúan con sistemas reales.
Anthropic ha reconocido públicamente que la inyección de instrucciones es uno de los mayores desafíos para los agentes de IA modernos. La empresa sostiene que Claude Cowork incluye avisos y controles pensados para que los usuarios supervisen las acciones del agente. No obstante, varios analistas señalan que esperar que usuarios no técnicos detecten comportamientos anómalos es poco realista, especialmente cuando los procesos ocurren de forma automática y silenciosa.
Este incidente llega en un momento clave para la industria, donde cada vez más compañías apuestan por IA “agentiva” capaz de ejecutar acciones sin intervención constante. El caso de Claude Cowork refuerza la preocupación de que dar acceso directo a archivos y APIs potentes amplifica enormemente el impacto de cualquier fallo de seguridad, incluso si el modelo subyacente es considerado seguro a nivel conversacional.
Para las empresas, el riesgo no es solo teórico. Un ataque exitoso podría implicar la filtración de documentos internos, información personal o datos estratégicos, con consecuencias legales y reputacionales importantes. Por ello, expertos recomiendan limitar el uso de este tipo de agentes en entornos sensibles hasta que existan mecanismos más robustos de aislamiento, permisos granulares y verificación de acciones.
En conclusión, el problema detectado en Claude Cowork subraya que la evolución de la inteligencia artificial hacia sistemas autónomos debe ir acompañada de avances equivalentes en seguridad. El incidente no solo afecta a Anthropic, sino que sirve como advertencia para toda la industria sobre los riesgos de lanzar agentes con amplios permisos sin protecciones suficientemente maduras.





