Reporta Anthropic hackeó de su IA a tres organizaciones

Fecha:

  • Anthropic indicó que revisó 141 mil 006 pruebas de evaluación y encontró tres casos en los que su herramienta de IA pirateó organizaciones externas.
STAFF / AR

SAN FRANCISCO, EU.- La empresa tecnológica Anthropic anunció que sus modelos de inteligencia artificial vulneraron la seguridad de tres organizaciones diferentes durante pruebas de ciberseguridad fallidas, poco más de una semana después de que su principal competidor, OpenAI, revelara un incidente similar.

Anthropic explicó en una publicación de blog el jueves que realizó el descubrimiento tras revisar sus propias pruebas de ciberseguridad, luego del anuncio de OpenAI sobre la brecha de seguridad.

Tanto en las pruebas de OpenAI como en las de Anthropic, los modelos de IA pudieron acceder a internet desde entornos de prueba que deberían haber estado aislados, según el blog de Anthropic.

La compañía indicó que revisó 141 mil 006 pruebas de evaluación y encontró tres casos en los que su herramienta de IA Claude accedió a internet y posteriormente pirateó la infraestructura real de organizaciones externas. Los primeros incidentes datan de abril, según la compañía.

- Anuncio -

Las organizaciones afectadas no se mencionan en el blog. No incluyen a Hugging Face, ni a la plataforma en la nube Modal, según una persona familiarizada con el asunto.

Los modelos de OpenAI que piratearon Hugging Face también obtuvieron acceso a la cuenta de un cliente de Modal, todo para resolver solicitudes, lo que propició que la AI hiciera “practicamente trampa” para resolver.

Más de 1,100 empleados de empresas de inteligencia artificial firmaron el martes una petición, según informó la agencia Bloomberg, en la que solicitan al gobierno estadounidense que apoye un mecanismo que ayude a regular el ritmo del desarrollo de la IA, para evitar que la tecnología avance demasiado rápido.

Ni Anthropic ni las organizaciones afectadas se percataron de las intrusiones. En su blog, Anthropic afirmó que podría haber revisado mejor los registros de red y las transcripciones de las evaluaciones.

La empresa reveló las brechas tres meses después de anunciar el desarrollo de un nuevo modelo de IA, conocido como Mythos, tan potente y potencialmente peligroso que su lanzamiento se vio estrictamente limitado.

Según el blog, las brechas afectaron a tres modelos de IA diferentes que escaparon de los entornos de prueba restringidos: Opus 4.7, Mythos 5 y un modelo de prueba de investigación interna. Cada uno de los modelos se ejecutó sin las medidas de seguridad que normalmente se implementan en las herramientas públicas.

Según el blog, Claude comprometió las organizaciones utilizando técnicas básicas como la explotación de contraseñas débiles.

Todos los incidentes ocurrieron cuando Anthropic utilizaba entornos de evaluación creados por la empresa de seguridad de IA Irregular. En todos los casos, Anthropic especificó a Claude que su entorno era una simulación y que no tenía acceso a internet. Según Anthropic, esto era falso.

“Debido a un malentendido entre nosotros y nuestro socio de evaluación, esto no fue así”, afirma el blog.

Cuando los modelos obtuvieron acceso no autorizado a otras tres organizaciones, las trataron como parte de un ejercicio. Las pruebas eran evaluaciones de “captura la bandera”, en las que los modelos buscaban información oculta vulnerando otros sistemas, una forma común de probar las capacidades de hacking tanto de humanos como de IA.

Un portavoz de Irregular declaró que la empresa agradece la colaboración y la transparencia de Anthropic. La investigación de la empresa continúa, añadió el portavoz.

- Anuncio -
Guardar esta Publicación

Compartir:

Suscríbete

Lo + Popular

Más como esto
Relacionado

Alerta la disminución de agua subterránea

Chile, Europa, Oriente Medio, India, Sudáfrica, Australia y EU, así como México, destacan como regiones con déficits persistentes de agua subterránea.

Alimenta México ‘la mesa’ de EU

De enero a julio, las exportaciones mexicanas en este sector crecieron 2.1%, mientras las importaciones aumentaron 5.7%, reduciendo 15.9% el superávit del País.

Atraen caso a CDMX; no hallan huachicol

Autoridades reportaron la incautación de 59 millones de litros de "presunto hidrocarburo" y el aseguramiento de 10 tanques de almacenamiento.

Participan 33 millones en Segundo Simulacro Nacional

La Secretaría de Educación Pública reportó la participación en el simulacro de 16 millones 772 mil 776 personas en 18 mil 293 inmuebles escolares.

Continuar leyendo ...
Relacionado