Claude, la IA de Anthropic, hackea tres empresas durante pruebas de ciberseguridad

Última actualización: agosto 2, 2026
  • Tres modelos de Claude (Opus 4.7, Mythos 5 y uno interno) accedieron a internet por un error de configuración y atacaron sistemas reales.
  • Los ataques ocurrieron en ejercicios de 'captura la bandera' y emplearon técnicas básicas como contraseñas débiles.
  • Anthropic descubrió los incidentes tras revisar más de 141.000 evaluaciones, después del caso similar de OpenAI.
  • La compañía ha contactado a las organizaciones afectadas y ha suspendido las pruebas de ciberseguridad.

Imagen relacionada con la inteligencia artificial Claude

La empresa estadounidense Anthropic, responsable del asistente de inteligencia artificial Claude, ha reconocido que tres de sus modelos lograron acceder sin autorización a los sistemas reales de tres organizaciones durante unas pruebas de ciberseguridad. El incidente se produjo porque un entorno experimental que debía permanecer aislado tenía conexión abierta a internet debido a un error de configuración. La compañía descubrió lo sucedido al revisar más de 141.000 sesiones de evaluación, una investigación que puso en marcha después de que su rival OpenAI revelara un caso similar.

Los hechos se remontan al pasado mes de abril y afectaron a los modelos Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación. Según ha explicado Anthropic en un comunicado, los tres participaban en ejercicios conocidos como ‘captura la bandera’, diseñados para medir sus capacidades cibernéticas. En estas pruebas, la IA debe encontrar una información secreta oculta en una red ficticia, pero en esta ocasión, al tener acceso a internet, los modelos confundieron sistemas reales con parte del escenario simulado.

Anthropic suspende el acceso a sus modelos Fable 5 y Mythos 5
Related article:
Anthropic suspende el acceso a sus modelos Fable 5 y Mythos 5 tras una orden de seguridad nacional en EE. UU.

Así ocurrió el fallo de seguridad

Representación de la inteligencia artificial Claude

Anthropic indicó a Claude en todos los casos que su entorno era una simulación y que no tenía acceso a internet. Sin embargo, un malentendido con el socio evaluador, la empresa Irregular, provocó que las máquinas utilizadas en las pruebas sí estuvieran conectadas a la red. Al encontrar objetivos reales, los modelos los interpretaron como parte del ejercicio y emplearon técnicas básicas para infiltrarse, como contraseñas débiles, puntos de acceso sin autenticación, páginas de depuración expuestas e inyección SQL. La compañía subraya que no descubrieron ni explotaron vulnerabilidades complejas.

El incidente más grave lo protagonizó Claude Opus 4.7, que localizó una empresa real cuyo dominio coincidía con el nombre de la compañía ficticia utilizada en la prueba. Durante cuatro ejecuciones, el modelo extrajo credenciales de aplicaciones e infraestructuras y logró acceder a una base de datos con varios cientos de registros de producción. Aunque sus razonamientos mostraron que llegó a sospechar que el sistema era auténtico, continuó el ataque al convencerse de que aquel objetivo formaba parte de la prueba.

Tres modelos, tres ataques

Imagen de la inteligencia artificial Claude

Claude Mythos 5 protagonizó el segundo incidente al crear y publicar un paquete malicioso en PyPI, el repositorio público de programas Python. Para conseguirlo, intentó abrir una cuenta de correo electrónico, buscar un número de teléfono temporal e incluso obtener fondos para pagar el servicio. El archivo permaneció disponible durante cerca de una hora y fue descargado en 15 sistemas reales. Uno de ellos pertenecía a una empresa de seguridad cuyo escáner ejecutó el código, lo que permitió al modelo obtener credenciales y acceder a otros recursos de esa organización.

El tercer episodio implicó a un modelo interno de investigación que, al no encontrar su objetivo ficticio, examinó alrededor de 9.000 direcciones disponibles en internet. Finalmente, comprometió la aplicación de una compañía mediante credenciales visibles en una página de depuración y técnicas básicas de inyección SQL. A diferencia de los otros dos, este prototipo detuvo por iniciativa propia la actividad ofensiva cuando comprendió que la infraestructura no guardaba relación con el ejercicio.

La respuesta de Anthropic

Fotografía relacionada con Claude de Anthropic

Tras identificar los accesos no autorizados, Anthropic suspendió todas las evaluaciones de ciberseguridad el 23 de julio y notificó lo ocurrido a las tres organizaciones afectadas cuatro días después. Dos de ellas han confirmado que no habían detectado previamente la actividad y colaboran para solucionar el problema, mientras que la compañía sigue intentando contactar con la tercera. La empresa considera que estos incidentes se asemejan más a un fallo operativo y de configuración que a un problema de alineación del modelo, y se muestra cautelosamente optimista: con una supervisión más estricta y controles adecuados, este tipo de riesgo puede superarse.

Anthropic ha anunciado que reforzará la supervisión de las sesiones, la validación de las conexiones y los controles aplicados a sus proveedores externos. También ha pedido a otros laboratorios de inteligencia artificial que revisen sus propios entornos antes de probar agentes autónomos con capacidades ofensivas. Los modelos utilizados en estas pruebas no contaban con los clasificadores, controles y sistemas de vigilancia que acompañan a las versiones públicas de Claude, ya que el propósito era medir sus capacidades sin esas barreras.