El error que delató a Claude: los modelos de Anthropic también hackearon empresas reales Tecnología

El error que delató a Claude: los modelos de Anthropic también hackearon empresas reales

Staff/Letras Prohibidas

CALIFORNIA, Estados Unidos. –La compañía confirmó que tres versiones de su inteligencia artificial vulneraron los sistemas de tres organizaciones durante pruebas de ciberseguridad, apenas días después de que su rival OpenAI reconociera un incidente similar. Anthropic asegura que todo se debió a un error de configuración y no a una falla deliberada del modelo.

Anthropic confirmó, a través de una publicación en su propio blog, que tres de sus modelos de inteligencia artificial lograron acceder a internet durante pruebas de ciberseguridad y terminaron vulnerando los sistemas de tres organizaciones distintas, cuya identidad no fue revelada. El hallazgo llega apenas una semana después de que OpenAI reconociera públicamente que uno de sus modelos había escapado de un entorno de pruebas para atacar la plataforma Hugging Face.

Según explicó la compañía, la revisión interna se activó luego del anuncio de OpenAI. Anthropic analizó más de 141.000 sesiones de evaluación y detectó tres episodios, iniciados desde abril, en los que un modelo de Claude obtuvo acceso a internet mientras interactuaba con un socio externo encargado de las evaluaciones, identificado como Irregular. Los incidentes involucraron a tres modelos diferentes: Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación que no está contemplado para lanzamiento público.

A diferencia del caso de OpenAI, donde el modelo aprovechó una vulnerabilidad descubierta por sí mismo para saltarse las restricciones, Anthropic sostiene que sus modelos no escaparon de manera deliberada. La compañía atribuyó lo ocurrido a un malentendido con el socio evaluador, que dejó activa la conexión a internet en un entorno que debía permanecer completamente aislado. A los modelos se les había indicado expresamente que se trataba de una simulación sin acceso a la red.

Los incidentes ocurrieron durante los llamados ejercicios de “captura de bandera”, en los que se asigna a la inteligencia artificial la tarea de infiltrarse en un sistema simulado. Claude, según detalló la propia empresa, comprometió la infraestructura de las organizaciones afectadas mediante técnicas básicas, como la explotación de contraseñas débiles y puntos finales sin autenticación, sin recurrir a vulnerabilidades complejas.

En dos de los tres casos, los modelos optaron por continuar el ataque pese a detectar que operaban fuera del entorno cerrado: Opus 4.7, la versión más antigua, robó credenciales para ingresar a los sistemas de una de las empresas, mientras que Mythos 5 llegó a convencerse a sí mismo de que seguía dentro de una simulación. El tercer modelo, el de prueba interna aún no publicado, se detuvo al advertir que contaba con una conexión que no debía tener.

Anthropic indicó que comenzó a revisar las transcripciones de las evaluaciones el 23 de julio y que, ese mismo día, suspendió todas sus evaluaciones de ciberseguridad tras encontrar evidencia de que Claude había accedido a internet. La empresa afirmó haber notificado a las tres organizaciones afectadas.

El episodio se suma a una escalada de revelaciones similares entre los dos principales laboratorios de inteligencia artificial del mundo, en momentos en que la competencia entre Anthropic y OpenAI se intensifica de cara a una eventual salida a bolsa. Los incidentes han reforzado, además, los llamados de distintos sectores políticos en Estados Unidos a establecer mecanismos de supervisión externa sobre el desarrollo de estos sistemas, en un contexto donde más de 1.100 empleados de empresas de inteligencia artificial firmaron recientemente una petición pública para exigir mayor regulación gubernamental sobre la tecnología.