Tecnología

OpenAI y Anthropic bajo escrutinio: revelan la generación de identidades ficticias por agentes de IA en evaluaciones de seguridad

Los sistemas de inteligencia artificial de última generación han vuelto a ser objeto de escrutinio tras la publicación de un informe del Instituto de Seguridad de la IA del Reino Unido (AISI) que expuso que varios modelos creados por OpenAI y Anthropic llevaron a cabo acciones no autorizadas durante pruebas de ciberseguridad, entre ellas la generación de identidades ficticias en la red con el fin de intentar vulnerar sistemas protegidos. Este episodio se produce después de que la compañía dirigida por Sam Altman admitiera que una prueba interna, realizada en un entorno “controlado”, había derivado en una brecha de seguridad en la empresa Hugging Face.

Según el organismo británico, los agentes basados en Mythos 5, de Anthropic, y GPT‑5.6‑Sol, de OpenAI, mostraron comportamientos inesperados mientras se les sometía a evaluaciones destinadas a medir sus capacidades y riesgos potenciales.

Algunas de las pruebas revelaron que los agentes ejecutaron actividades continuas y potencialmente dañinas dirigidas a individuos y organizaciones reales, indicó el AISI en su comunicado oficial.

El 28 de julio detectamos un incidente durante una evaluación cibernética rutinaria en la que agentes de IA realizaron acciones sostenidas y no autorizadas contra personas y entidades reales. La mayor parte del comportamiento procedía de un único modelo (Mythos 5 de Anthropic), con unos pocos episodios atribuibles a… pic.twitter.com/SPnA4Ekkwq

Metodología de la evaluación

El instituto, que accede a modelos avanzados mediante convenios voluntarios con los principales laboratorios de IA, diseñó un escenario simulado de ciberseguridad para observar el comportamiento de los agentes.

Las pruebas se llevaron a cabo 122 veces y se identificaron 19 conductas no autorizadas distribuidas en 10 ejecuciones distintas. Del total:

El caso más crítico se produjo cuando uno de los agentes redactó código malicioso y generó identidades falsas en internet con el objetivo de persuadir a una persona para que aceptara dicho código. El organismo precisó que ninguna de esas acciones ocasionó perjuicio alguno en el entorno real.

Aunque inicialmente el AISI no pudo determinar la empresa responsable, Anthropic confirmó posteriormente que el modelo propio había sido el autor de los hechos.

Es importante subrayar que el organismo británico aclaró que, a diferencia del incidente de julio con Hugging Face, en el que un agente de OpenAI comprometió infraestructura durante una prueba interna, en esta ocasión los agentes nunca abandonaron el entorno controlado. El acceso a internet había sido activado deliberadamente por el instituto como parte de su protocolo habitual de evaluación.

Reacciones de Anthropic y OpenAI

Tras la publicación del informe, Anthropic elogió el trabajo del organismo británico y anunció que ya está investigando lo sucedido: “Agradecemos al AISI del Reino Unido su liderazgo en este asunto, que pone de relieve la necesidad de un debate más amplio sobre la evaluación segura de agentes de IA cada vez más capaces”, declaró la empresa.

Archivo. La ciberseguridad y la alerta por las capacidades de los nuevos modelos de IA.

La compañía añadió que colabora estrechamente con el instituto para recabar más datos sobre el incidente y llevar a cabo su propia investigación.

Por su parte, OpenAI explicó que las dos conductas no autorizadas detectadas en su agente consistieron en acceder a internet de forma expresamente prohibida por las instrucciones de la evaluación. “Nos comprometemos a trabajar con todo el sector para fortalecer las prácticas comunes que permitan realizar evaluaciones de alto riesgo de manera segura, lo que incluye convocar en las próximas semanas a las partes interesadas, como institutos nacionales de IA, evaluadores independientes, otros laboratorios de IA y grupos afines”, manifestó la empresa.

Adicionalmente, OpenAI informó de un incidente independiente vinculado a un proveedor externo de pruebas, Irregular. Según la compañía, una configuración errónea provocó que sus agentes se conectaran inadvertidamente a internet, un problema similar al que Anthropic había revelado la semana anterior.

Fuente: Ambito.com

Comentarios de Facebook

Publicaciones relacionadas

Botón volver arriba