Reporta Anthropic hackeó de su IA a tres organizaciones

Fecha:

  • Anthropic indicó que revisó 141 mil 006 pruebas de evaluación y encontró tres casos en los que su herramienta de IA pirateó organizaciones externas.
STAFF / AR

SAN FRANCISCO, EU.- La empresa tecnológica Anthropic anunció que sus modelos de inteligencia artificial vulneraron la seguridad de tres organizaciones diferentes durante pruebas de ciberseguridad fallidas, poco más de una semana después de que su principal competidor, OpenAI, revelara un incidente similar.

Anthropic explicó en una publicación de blog el jueves que realizó el descubrimiento tras revisar sus propias pruebas de ciberseguridad, luego del anuncio de OpenAI sobre la brecha de seguridad.

Tanto en las pruebas de OpenAI como en las de Anthropic, los modelos de IA pudieron acceder a internet desde entornos de prueba que deberían haber estado aislados, según el blog de Anthropic.

La compañía indicó que revisó 141 mil 006 pruebas de evaluación y encontró tres casos en los que su herramienta de IA Claude accedió a internet y posteriormente pirateó la infraestructura real de organizaciones externas. Los primeros incidentes datan de abril, según la compañía.

- Anuncio -

Las organizaciones afectadas no se mencionan en el blog. No incluyen a Hugging Face, ni a la plataforma en la nube Modal, según una persona familiarizada con el asunto.

Los modelos de OpenAI que piratearon Hugging Face también obtuvieron acceso a la cuenta de un cliente de Modal, todo para resolver solicitudes, lo que propició que la AI hiciera “practicamente trampa” para resolver.

Más de 1,100 empleados de empresas de inteligencia artificial firmaron el martes una petición, según informó la agencia Bloomberg, en la que solicitan al gobierno estadounidense que apoye un mecanismo que ayude a regular el ritmo del desarrollo de la IA, para evitar que la tecnología avance demasiado rápido.

Ni Anthropic ni las organizaciones afectadas se percataron de las intrusiones. En su blog, Anthropic afirmó que podría haber revisado mejor los registros de red y las transcripciones de las evaluaciones.

La empresa reveló las brechas tres meses después de anunciar el desarrollo de un nuevo modelo de IA, conocido como Mythos, tan potente y potencialmente peligroso que su lanzamiento se vio estrictamente limitado.

Según el blog, las brechas afectaron a tres modelos de IA diferentes que escaparon de los entornos de prueba restringidos: Opus 4.7, Mythos 5 y un modelo de prueba de investigación interna. Cada uno de los modelos se ejecutó sin las medidas de seguridad que normalmente se implementan en las herramientas públicas.

Según el blog, Claude comprometió las organizaciones utilizando técnicas básicas como la explotación de contraseñas débiles.

Todos los incidentes ocurrieron cuando Anthropic utilizaba entornos de evaluación creados por la empresa de seguridad de IA Irregular. En todos los casos, Anthropic especificó a Claude que su entorno era una simulación y que no tenía acceso a internet. Según Anthropic, esto era falso.

“Debido a un malentendido entre nosotros y nuestro socio de evaluación, esto no fue así”, afirma el blog.

Cuando los modelos obtuvieron acceso no autorizado a otras tres organizaciones, las trataron como parte de un ejercicio. Las pruebas eran evaluaciones de “captura la bandera”, en las que los modelos buscaban información oculta vulnerando otros sistemas, una forma común de probar las capacidades de hacking tanto de humanos como de IA.

Un portavoz de Irregular declaró que la empresa agradece la colaboración y la transparencia de Anthropic. La investigación de la empresa continúa, añadió el portavoz.

- Anuncio -
Guardar esta Publicación

Compartir:

Suscríbete

Lo + Popular

Más como esto
Relacionado

Se declara culpable hermano de ‘El Mencho’ en EU

Según la acusación criminal en su contra, "Tony Montana" no sólo estaba involucrado en las actividades de tráfico sino que también importó precursores químicos.

Argentina expulsará extranjeros por odio, decreta Milei

Javier Milei prohibió el ingreso a Argentina y habilitó la expulsión de personas extranjeras que emitan expresiones de odio contra los argentinos.

Denuncia UNICEF 2,500 niños muertos y heridos en Irán

Estas cifras podrían ser mucho menores de lo que realmente está sucediendo en ese país, si se toma en cuenta las 175 niñas muertas tan sólo en un bombardeo.

Condenan a padre e hijo por tiroteo escolar en Georgia

Un juez de Georgia condenó a cadena perpetua sin libertad condicional a Colt Gray por matar a cuatro personas en una escuela; su padre recibió 15 años de prisión por darle el rifle usado en el ataque.

Continuar leyendo ...
Relacionado