Una empresa de seguridad construyó una máquina desechable para que su agente codificador la estropee
Trail of Bits lanzó Coop, una herramienta de línea de comandos que pone en marcha máquinas virtuales desechables donde Claude Code y Codex obtienen acceso completo a las herramientas sin tocar su propia computadora. Utiliza Firecracker en Linux y Lima en macOS.
La consultora de seguridad Trail of Bits ha lanzado Coop y responde a una pregunta que mucha gente ha estado evitando silenciosamente: ¿qué sucede si el agente de codificación al que le diste permiso completo hace algo que no deseas? Coop es una pequeña herramienta de línea de comandos que crea máquinas virtuales desechables donde agentes como Claude Code y OpenAI’s Codex obtienen acceso completo a Docker, git, compiladores y administradores de paquetes, sin que ninguno de ellos toque su computadora real. Cada máquina está aislada, es reproducible y lo suficientemente barata como para desecharla y volver a fabricarla.
La mecánica no es glamorosa y ese es el punto. En Linux, el programa de instalación instala Firecracker, la tecnología de máquina virtual liviana que Amazon creó para su plataforma sin servidor, y obtiene un kernel invitado. En macOS, primero necesita instalar Lima, a través de Homebrew, o la configuración falla. Trail of Bits ha estado construyendo esta categoría por un tiempo: también mantiene un contenedor de desarrollo para ejecutar Claude Code con solicitudes de permiso desactivadas dentro de un contenedor que solo puede llegar al directorio de su proyecto, y una herramienta para activar servidores en la nube desechables para el mismo propósito. Los tres existen porque la empresa se gana la vida revisando códigos que no son de confianza y no quería que el agente se acercara a la computadora portátil del auditor.
Por qué el botón “sí a todo” es el problema. Los agentes codificadores piden permiso antes de ejecutar comandos, y después del vigésimo mensaje todos lo desactivan, porque la herramienta sólo es rápida si dejas de supervisarla. El problema es que la misma configuración que detiene las interrupciones también elimina la última verificación en un sistema que felizmente ejecutará un comando que leyó mal, o uno que llegó oculto dentro de un archivo que se le pidió leer. Ese segundo caso tiene un nombre, inyección de prompts, y es la razón por la que el aislamiento vence a la precaución: no puede leer de manera confiable todas las instrucciones que encuentra su agente, pero puede asegurarse de que la máquina en la que se encuentra no importe. El sandboxing no es una declaración sobre cuánto confías en el modelo. Es lo que haces para que la confianza deje de ser una carga.
Qué significa esto para usted. Si utiliza un agente de codificación en modo permisivo en su máquina principal, esta es la semana para cambiar eso, y Coop es una de varias formas razonables de hacerlo. Anthropic incluye opciones de sandbox en la propia documentación de Claude Code, los devcontainers funcionan en VS Code y una instancia de nube barata que destruyes después también funciona. Elija el que se ajuste a su configuración en lugar del que tenga el mejor archivo Léame. Si no se escribe código, la idea transferible sigue siendo válida: cuando se le da a una herramienta de IA la capacidad de actuar en lugar de simplemente responder, la pregunta que vale la pena hacerse no es “¿se comportará?” sino “¿qué puede alcanzar si no lo hace?”.
Fuentes
Fuentes: https://github.com/trailofbits/coop
Anthropic's Fable 5.1 cuesta lo mismo, excepto por la parte que más usan los agentes
Claude Fable 5.1 se lanzó el 1 de septiembre con un precio principal sin cambios de 10 dólares y 50 dólares por millón de tokens, pero las lecturas de caché cayeron un 75 por ciento a 0,25 dólares. Anthropic dice que eso ahorra alrededor del 25 por ciento en el trabajo típico.