Tecnología

OpenAI difiere el despliegue de su modelo ante consideraciones críticas de seguridad y alineación

OpenAI optó por posponer la puesta en marcha del nuevo sistema de IA – GPT‑6.1 Astra – tras intensos debates sobre los riesgos asociados a la velocidad con que avanza esta tecnología. Saachi Jain, directora de seguridad de la compañía, declaró: “Aunque (GPT‑6.1 Astra) mostró avances en la rapidez del modelo, no alcanzó los estándares esperados en cuanto a permanecer dentro de los límites autorizados y en la manera de informar al usuario sobre las tareas realizadas”.

El anuncio se realizó el lunes pasado, justo antes de la reunión entre el presidente de EE. UU., Donald Trump, y los líderes más influyentes del sector de la inteligencia artificial, entre ellos Greg Brockman (OpenAI), Mark Zuckerberg (Meta), Sundar Pichai (Google) y Elon Musk (xAI).

OpenAI aplaza un modelo nuevo por inquietudes de seguridad

La responsable de la seguridad en IA de OpenAI explicó que GPT‑6.1 quedó por debajo del desempeño de su predecesor, GPT‑6, en dos dimensiones relacionadas con el alineamiento, es decir, su capacidad para obedecer las instrucciones de sus creadores. En particular, el modelo tiende a intentar engañar a sus supervisores omitiendo datos sobre acciones que ejecutó o que no ejecutó.

Frente a estos hallazgos, la empresa decidió retrasar la comercialización del modelo para asegurar que cumpla con las directrices y restricciones establecidas. Esta medida subraya la creciente complejidad de controlar sistemas de IA a medida que estos adquieren habilidades más sofisticadas.

Jain señaló que el modelo había reforzado su habilidad para completar tareas de forma sostenida, pero que era necesario equilibrar esa mejora con la prevención de conductas no autorizadas. En sus palabras, la compañía busca garantizar la seguridad del modelo tanto en pruebas internas como cuando sea puesto en manos de usuarios: “Mantenemos un umbral extremadamente exigente en materia de seguridad y alineamiento”.

La semana anterior, OpenAI había detenido el entrenamiento de sus sistemas más avanzados, indicando que lo reanudaría “únicamente cuando tengamos la certeza de contar con mecanismos de protección adicionales”.

How we think about securing frontier RL training runs: https://t.co/yrvjpfa7Pd

El lunes, el Instituto de Seguridad de la IA (AISI) del gobierno británico publicó un informe que reveló que GPT‑6 Astra se desvió de su trayectoria con mayor frecuencia que sus predecesores GPT‑5.6 Sol, publicado a principios de julio, y GPT‑5.5, lanzado en abril.

Antes del aplazamiento, inicialmente reportado por The Wall Street Journal, el director ejecutivo de OpenAI, Sam Altman, se unió a otros dirigentes del sector para solicitar una desaceleración, advirtiendo que las empresas aún no disponen de salvaguardas suficientes para controlar los sistemas más potentes.

Altman tiene previsto pronunciar el discurso principal de la conferencia anual de OpenAI para desarrolladores el martes en San Francisco. Por su parte, el presidente de OpenAI, Greg Brockman, asistirá al evento en la Casa Blanca el mismo día.

OpenAI refuerza sus directrices de seguridad

Ese mismo lunes, OpenAI publicó en su blog oficial un documento que enfatiza la necesidad de contar con documentación estructurada de seguridad antes de proseguir con determinadas ejecuciones de entrenamiento de sus modelos de vanguardia.

“Estamos entrando en una era donde se debe exigir documentación estructurada de seguridad antes de iniciar cualquier ejecución de entrenamiento por refuerzo de frontera. Idealmente, dicha documentación alcanzaría el nivel de “casos de seguridad”: argumentos exhaustivos, estructurados y basados en evidencia sobre los riesgos, tal como se practica en otras industrias críticas”, explicó la compañía.

Archivo. Trump aseguró que “quien gane la IA, gana”.

Esta definición se dio a conocer después de que OpenAI revelara incidentes en los que agentes de IA excedieron sus instrucciones, incluso accediendo sin autorización a sitios web gubernamentales.

“Consideramos los casos de seguridad como una meta aspiracional a la que avanzamos, reconociendo al mismo tiempo la dificultad de lograr la misma rigurosidad que se exige en sectores como la aviación o la energía nuclear, debido a la complejidad emergente que acompaña a cada nuevo nivel de capacidad de IA. Estamos elaborando un marco para codificar estas prácticas”, añadió la empresa.

A partir de este enfoque, OpenAI describió un conjunto de medidas vinculadas a la seguridad y al alineamiento de sus modelos, organizadas en tres áreas principales:

Fuente: Ambito.com

Comentarios de Facebook

Publicaciones relacionadas

Botón volver arriba