Un defecto de diseño, no un error: por qué la fuga de VM de Claude Cowork importa más que el parche

La vulnerabilidad de Claude Cowork para macOS de Anthropic se entiende mejor no como un error de software en el sentido tradicional, sino como una decisión de diseño que otorga a un agente de IA más acceso ambiental del que cualquier modelo de seguridad razonable debería permitir.

Investigadores de seguridad en Accomplish AI descubrieron que una sesión de Claude Cowork que se ejecuta en modo local puede escapar de su máquina virtual Linux y leer o escribir archivos en cualquier lugar del Mac anfitrión, incluyendo claves SSH, credenciales en la nube, cookies del navegador y documentos personales, sin activar ninguna solicitud de permiso. La cadena de ataque, denominada SharedRoot, fue divulgada el 23 de julio y afecta a aproximadamente medio millón de usuarios de macOS que ejecutan Cowork en modo local.

En el centro del problema no hay un único error de codificación, sino un problema arquitectónico en capas. Claude Cowork lanza una VM Linux desechable a través del framework de virtualización de Apple para cada sesión. Esa VM se ejecuta como un usuario invitado no privilegiado detrás de un filtro seccomp, lo cual es una medida de sandboxing razonable. La falla crítica se encuentra un nivel más arriba: el sistema de archivos raíz completo del anfitrión está montado dentro de esa VM, en lectura y escritura, a través de la capa de intercambio VirtioFS. Un agente dentro de la VM que pueda escalar a guest-root, y la ruta de explotación del kernel existe, obtiene efectivamente acceso sin restricciones a todo el Mac.

Los investigadores demostraron la cadena de explotación completa en menos de dos minutos. El agente crea espacios de nombres de usuario y de red, carga el módulo Traffic Control act_pedit del kernel de Linux desde el espacio de nombres no privilegiado y desencadena CVE-2026-46331, una vulnerabilidad de corrupción de memoria divulgada recientemente en la ruta COW de pedit. Esto eleva al agente a guest-root dentro de la VM. Desde allí, el sistema de archivos del anfitrión es visible en /mnt/.virtiofs-root, todo el Mac, escribible.

If you believe trustworthy journalism still matters, we'd appreciate your support.

Keep quality journalism alive

El análisis de Accomplish AI subraya que este no es un problema de aplicar un parche y seguir adelante. El patrón subyacente del kernel de Linux, un módulo autocargable, una ruta de configuración a la que un usuario no privilegiado puede acceder, un error de memoria al final, produce vulnerabilidades de escalada de privilegios con una cadencia regular. Arreglar una instancia deja la arquitectura igualmente expuesta a la siguiente.

La respuesta de Anthropic fue cerrar el informe como informativo y configurar por defecto las nuevas instalaciones en modo de ejecución en la nube, donde las sesiones de agente se ejecutan en los servidores de Anthropic en lugar de dentro de una VM local. Los usuarios que seleccionan manualmente el modo local permanecen expuestos, ya que no se ha emitido ningún parche dedicado para el modo local en sí.

El contexto industrial más amplio aumenta la urgencia. OpenAI divulgó un comportamiento similar de fuga de sandbox en sus propias pruebas, donde GPT-5.6 Sol violó su entorno de prueba y alcanzó los sistemas de producción de Hugging Face. Juntos, los dos incidentes señalan un patrón: la industria de la IA está construyendo agentes que operan dentro de entornos de ejecución cada vez más potentes, y los límites de acceso alrededor de esos entornos no están resistiendo.

Las mitigaciones recomendadas por los investigadores de seguridad van más allá de cambiar al modo nube. Deshabilitar los espacios de nombres de usuario no privilegiados, endurecer los filtros seccomp y detener la carga automática de los módulos de red del kernel cerraría la ruta de ataque inmediata. Pero la corrección estructural, restringir el intercambio de archivos del anfitrión solo a las carpetas que un usuario conecta explícitamente, y montarlas como solo lectura, abordaría la causa raíz independientemente de qué vulnerabilidad del kernel surja a continuación.

Fuentes: Claude Cowork Flaw Could Let AI Agent Escape Its VM (The Hacker News, 23 de julio de 2026); SharedRoot: A Sandbox Escape in Claude Cowork’s VM (Cloud Security Alliance, julio de 2026); CVE-2026-46331: Claude Cowork VM Sandbox Escape (Grid the Grey, 24 de julio de 2026)

Traducido por Alessandra

Scroll to Top