¡Por error! Hackeó IA Claude tres servidores reales durante prueba
Imágen generada con IA
La compañía Anthropic, dio a conocer que tres modelos de su IA Claude, terminaron por hackear por error tres servidores reales durante varias pruebas que le estaban haciendo a la aplicación.
Por: Redacción 31 Julio 2026 09 27
Anthropic comenzó a revisar sus pruebas después del reciente y similar incidente protagonizado por modelos de OpenAI, que lograron salir de un entorno aislado y entrar en la infraestructura de producción de Hugging Face.
Tras conocerse lo ocurrido, Anthropic examinó más de 140 mil ejecuciones de sus propias evaluaciones, encontrando tres incidentes diferentes repartidos en seis pruebas en las que participaron sus IA Claude Opus 4.7, Claude Mythos 5 y un modelo experimental que todavía no está preparado para lanzamiento.
Los modelos recibieron la instrucción de que no podían acceder a internet, pero las máquinas utilizadas en las pruebas sí tenían conexión, la cuál ni Anthropic ni su socio evaluador habían detectado.
Por esa razón, Claude creyó que todo lo que encontraba formaba parte del escenario ficticio. Su misión era entrar en los sistemas y localizar una clave secreta, así que “hackeo” a las compañías sin comprender inicialmente que había entrado a servidores reales.
Al no poder entrar en el sistema simulado, Claude Opus 4.7 localizó la red verdadera, aprovechó varios fallos y consiguió credenciales de acceso y una base de datos con varios cientos de registros reales.
En otra prueba, Claude Mythos 5 publicó un programa malicioso en PyPI, una especie de tienda desde la que los programadores descargan herramientas, que permaneció disponible por una hora y llegó a ejecutarse en 15 ordenadores reales.
Mythos llegó a plantearse que publicar el archivo sería un ataque real si estuviese conectado a internet y terminó por convencerse de que seguía dentro de una simulación y continuó con la prueba.
El tercer hackeo fue del modelo experimental, el cuál escaneó unos nueve mil objetivos hasta encontrar una aplicación expuesta a la que entró mediante contraseñas y fallos conocidos, pero se detuvo cuando comprendió que el servidor no tenía relación con el ejercicio ficticio.
Ante estos hechos, Anthropic afirma que Claude no trató de escapar ni desarrolló un objetivo propio, sino que solo se trata de un error que tiene que ver con una conexión a internet que quedó abierta y de una mala configuración.
Las Más Leídas
