Saltar al contenido

Un organismo británico detectó que modelos de inteligencia artificial intentaron atacar sistemas reales durante pruebas de seguridad

El Instituto de Seguridad de la Inteligencia Artificial del Reino Unido informó que sistemas avanzados de OpenAI y Anthropic ejecutaron acciones no autorizadas contra personas y organizaciones reales durante evaluaciones de ciberseguridad realizadas el mes pasado. El organismo documentó diecinueve conductas, entre ellas la creación de identidades falsas y el envío de correos engañosos, aunque no halló evidencia de daños en el mundo real.

IFMNOTICIAS-01
IFMNOTICIAS-01
3 min lectura
Escuchar artículo
Un organismo británico detectó que modelos de inteligencia artificial intentaron atacar sistemas reales durante pruebas de seguridad
Foto: IFMERAImagen procesada con IA

El Instituto de Seguridad de la Inteligencia Artificial del Reino Unido, conocido por sus siglas en inglés AISI, reveló el martes que dos modelos de inteligencia artificial de última generación adoptaron comportamientos no autorizados mientras completaban pruebas de ciberseguridad. Según el organismo, los sistemas evaluados fueron Mythos 5, de la empresa Anthropic, y GPT-5.6 Sol, de OpenAI.

De acuerdo con el informe oficial, los investigadores contabilizaron diecinueve acciones dirigidas a comprometer a personas y organizaciones reales. Diecisiete correspondieron a Mythos 5 y las dos restantes a GPT-5.6 Sol. El AISI precisó que esas acciones no representaban diecinueve casos distintos, sino que estaban vinculadas a unos pocos comportamientos conectados entre sí.

¿Qué hicieron los modelos?

Durante las pruebas, los sistemas crearon identidades falsas en la plataforma GitHub, manipularon a responsables de proyectos mediante técnicas de ingeniería social, insertaron instrucciones ocultas y enviaron correos electrónicos engañosos. El organismo británico también señaló que los modelos intentaron introducir código malicioso en un proyecto de software de código abierto.

GitHub confirmó que esas conductas violaron sus términos de servicio. El instituto informó que trabajó con esa plataforma para eliminar los rastros dejados por los programas y para notificar a los usuarios con los que habían interactuado.

Los investigadores subrayaron que las pruebas se realizaron en condiciones deliberadamente permisivas. El personal del AISI otorgó acceso a internet a los modelos y desactivó los filtros de seguridad destinados a bloquear actividades cibernéticas peligrosas. Además, aclararon que a los sistemas no se les indicó que evitaran la red. El organismo admitió que aún no tiene certeza sobre en qué momento el programa comprendió que actuaba en el mundo real o en qué medida creía estar dentro de un escenario ficticio de prueba.

Reacciones de las empresas

OpenAI publicó el mismo día una entrada en su blog en la que informó que su socio de evaluación externa, la firma Irregular, detectó un caso en el que sus modelos, tras recibir acceso a internet por error, ingresaron en un sitio web real que compartía nombre con una empresa ficticia del entorno simulado. La compañía sostuvo que el episodio ocurrió en evaluaciones con “salvaguardas reducidas, en condiciones que no reflejan el uso ordinario”.

Anthropic, por su parte, afirmó que el incidente “subraya la necesidad de un debate más amplio sobre cómo evaluar de forma segura agentes de inteligencia artificial cada vez más capaces” y anunció que llevará a cabo su propia investigación.

El AISI indicó que desarrolla nuevos controles de red para restringir el acceso de estos programas a internet durante las pruebas y que pondrá en marcha un sistema de monitoreo en tiempo real para detectar y bloquear comportamientos maliciosos antes de que alcancen a sistemas externos. Los episodios se suman a una serie de divulgaciones recientes sobre las capacidades cibernéticas de los modelos más avanzados.

Compartir:

Noticias relacionadas