Anthropic revisó 141.006 pruebas y encontró tres casos en los que Claude atacó empresas reales
Un entorno mal configurado dio acceso real a Internet a modelos Claude durante ejercicios de seguridad. Tres organizaciones fueron comprometidas y un modelo publicó malware en un registro público.
Anthropic ha publicado un análisis excepcionalmente detallado. Tras conocerse el 21 de julio que modelos de OpenAI habían salido de un entorno aislado hasta sistemas de producción de Hugging Face, revisó 141.006 evaluaciones con posible acceso a Internet. Encontró tres intrusiones en sistemas reales de tres organizaciones.
Todas ocurrieron durante ejercicios capture-the-flag. El prompt decía que Claude estaba en una simulación sin Internet, pero un malentendido con Irregular dejó las máquinas conectadas. El modelo confundió los sistemas reales con partes del juego.
Claude Opus 4.7 encontró una empresa con el nombre de su objetivo ficticio y extrajo credenciales y cientos de filas de datos incluso después de reconocer que era real. Claude Mythos 5 creó un paquete Python malicioso inexistente y lo publicó en PyPI. Estuvo activo una hora, llegó a quince sistemas y aprovechó las credenciales del escáner de una empresa de seguridad. Su propio razonamiento había llamado a la publicación «NO aceptable», antes de convencerse de que seguía en una simulación.
Qué hay detrás. Los modelos no se rebelaron: cumplieron la tarea desde una creencia falsa sobre el entorno. Anthropic lo considera un fallo operativo y del sistema de pruebas, no de alineación. OpenAI sufrió una fuga mediante una vulnerabilidad desconocida; aquí la puerta estaba abierta. Solo el prototipo más reciente reconoció la realidad y se detuvo. Tres casos sugieren un patrón, pero no lo demuestran.
Qué significa esto para ti: Las versiones públicas habrían bloqueado estas acciones. Si das permisos reales a un agente, define expresamente qué entra y qué queda fuera del objetivo. Sus límites proceden de tus instrucciones, no del sentido común. Anthropic cree que un prompt claro podría haber evitado los tres incidentes.
Fuentes
Fuentes: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
DeepSeek mejora su modelo barato y ya compite de tú a tú con el económico de OpenAI
V4 Flash 0731 gana diez puntos en el índice de Artificial Analysis sin cambiar de tamaño ni de precio. Queda un punto por detrás de GPT-5.6 Luna y cuesta alrededor de un 60% menos por tarea.