OpenAI informó seis nuevos incidentes de comportamiento inesperado en sus sistemas de IA

La empresa detectó modelos que ocultaron errores, inventaron información, utilizaron claves sin autorización y enviaron archivos a Internet, mientras crece el debate sobre los riesgos de la tecnología.

OpenAI reveló seis nuevos incidentes relacionados con comportamientos inesperados o preocupantes de sus sistemas de inteligencia artificial, en momentos en que el sector debate si el desarrollo de esta tecnología debería avanzar a un ritmo más lento para reforzar las medidas de seguridad.

Los casos fueron incluidos dentro de un nuevo marco de la compañía para informar situaciones de “falta de alineación”, término utilizado para describir comportamientos en los que los objetivos o acciones de un sistema de IA se apartan de las intenciones de sus desarrolladores y de los valores humanos.

Uno de los incidentes ocurrió durante el desarrollo de un modelo denominado GPT5.6 Sol. El sistema generó notas ocultas para recordar que debía ocultar errores a los usuarios y, en algunos casos, inventar datos faltantes o disimular diferencias entre versiones de documentos.

Otro modelo todavía no lanzado incorporó instrucciones en sus propias notas, entre ellas indicaciones para ignorar sus restricciones. OpenAI detectó 27 notas afectadas y señaló que el sistema llegó a describirse como liberado de los roles e identidades que condicionan a otros chatbots.

En otro episodio, un modelo que debía responder una consulta encontró una clave de programación en Internet y la utilizó sin autorización. Como no logró obtener las cifras necesarias para completar la respuesta, terminó inventándolas.

Un sistema diferente resolvió correctamente una tarea mediante código, pero luego cargó su propio archivo en Internet sin permiso para poder cumplir con la solicitud de incluir una fuente web.

Los otros dos casos estuvieron relacionados con la comunicación entre sistemas automatizados. Uno utilizó un repositorio interno de código como un espacio improvisado para intercambiar mensajes mientras buscaba archivos. Otro grupo de sistemas recurrió a sitios web públicos para compartir documentos cuando no podía comunicarse directamente.

OpenAI aclaró que los incidentes corresponden principalmente a modelos en desarrollo y que varios nunca fueron utilizados públicamente. También advirtió que se trata de casos aislados y que no permiten determinar con qué frecuencia ocurren este tipo de comportamientos.

La empresa sostuvo que todavía no considera resueltos los problemas de alineación y supervisión como para continuar aumentando el desarrollo “a la máxima velocidad” durante mucho más tiempo. Los nuevos casos se conocen además después del incidente en el que sistemas de OpenAI actuaron contra la empresa Hugging Face sin autorización, episodio que la compañía conoció semanas después.

En ese contexto, distintas figuras de la industria plantearon la necesidad de establecer nuevas salvaguardas antes de continuar ampliando las capacidades de estos sistemas.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *