OpenAI desvela casos en los que sus modelos de IA ocultaron errores y eludieron controles

La compañía tecnológica OpenAI revela un nuevo marco de transparencia tras detectar seis episodios graves de desalineamiento, donde sus sistemas falsificaron datos, usaron claves API sin permiso y violaron protocolos de seguridad
Actualidad Sala de redacción
Logotipo de OpenAI en una pantalla digital|Foto: Europa Press
Logotipo de OpenAI en una pantalla digital|Foto: Europa Press

El debate global sobre la seguridad y el control de la inteligencia artificial (IA) de frontera ha tomado un nuevo giro institucional. Según reporta el diario 20minutos, la empresa tecnológica OpenAI ha hecho públicos una serie de hallazgos internos que confirman cómo sus modelos en fase de desarrollo y prueba lograron ocultar errores, saltarse restricciones de seguridad y ejecutar acciones no autorizadas para alcanzar sus objetivos.

El anuncio coincide con el lanzamiento de un nuevo marco operativo diseñado para registrar, evaluar y divulgar abiertamente los incidentes de «desalineamiento» de sus sistemas.

Los seis episodios de desalineamiento detectados en laboratorio

Entre las situaciones documentadas por la firma liderada por Sam Altman, destaca el comportamiento registrado durante el entrenamiento de GPT-5.6 Sol.

En diversas instancias de evaluación, la herramienta optó por inventar datos históricos faltantes y encubrir discrepancias entre sus fuentes para evitar que los evaluadores detectaran fallos en sus respuestas.

En un segundo caso, un modelo de investigación aún no comercializado comenzó a inyectar instrucciones ocultas dentro de sus propios resúmenes de texto con el fin deliberado de eludir los filtros de moderación preestablecidos por los ingenieros.

Sam Altman pronostica sobre el futuro de la inteligencia artificial¿El fin de la inteligencia humana? La predicción de Sam Altman sobre la IA y los niños

Los comportamientos inesperados también afectaron a los protocolos de ciberseguridad y privacidad. Al buscar datos económicos sobre un condado estadounidense, uno de los sistemas localizó una clave API expuesta en la red, la utilizó sin autorización previa y, al no obtener la información completa, procedió a fabricar los datos faltantes.

Asimismo, otro agente de inteligencia artificial subió archivos privados a servidores públicos de internet sin permiso del usuario con el objetivo de poder citarlos mediante enlaces web, mientras que varios modelos colaborativos utilizaron repositorios internos y plataformas externas de almacenamiento para intercambiar archivos que debían permanecer estrictamente almacenados en servidores locales.

La respuesta de la industria y la falta de soluciones definitivas

Desde la cúpula directiva de la empresa se ha aclarado que estos seis incidentes no corresponden a interacciones convencionales de los usuarios en ChatGPT, sino a simulaciones complejas durante procesos de entrenamiento.

Sin embargo, los hallazgos reavivan la preocupación manifestada por otros líderes del sector tecnológico, como Mark Zuckerberg, quien advirtió recientemente que la adopción masiva de la tecnología se verá comprometida si los agentes digitales actúan de manera autónoma al margen de las órdenes directas de sus diseñadores.

Hasta la fecha, la notificación de estos incidentes se realizaba de forma esporádica. Con la implementación del nuevo marco de divulgación, cualquier empleado de la organización podrá alertar sobre anomalías para su investigación y posterior publicación, incluso si la causa técnica del fallo no ha sido completamente resuelta.

A pesar de estas medidas de transparencia, OpenAI concluye el informe con un diagnóstico contundente sobre el estado actual de la tecnología: «No creemos que la industria de la IA haya resuelto suficientemente el alineamiento y la supervisión», reconociendo que los métodos actuales de control siguen siendo insuficientes ante el vertiginoso avance de los algoritmos de última generación.

Con información de 20minutos

Te puede interesar
Lo más visto
Suscríbete al newsletter para recibir periódicamente las novedades en tu email