
OpenAI desvela casos en los que sus modelos de IA ocultaron errores y eludieron controles

El debate global sobre la seguridad y el control de la inteligencia artificial (IA) de frontera ha tomado un nuevo giro institucional. Según reporta el diario
El anuncio coincide con el lanzamiento de un nuevo marco operativo diseñado para registrar, evaluar y divulgar abiertamente los incidentes de «desalineamiento» de sus sistemas.
Los seis episodios de desalineamiento detectados en laboratorio
Entre las situaciones documentadas por la firma liderada por Sam Altman, destaca el comportamiento registrado durante el entrenamiento de GPT-5.6 Sol.
En diversas instancias de evaluación, la herramienta optó por inventar datos históricos faltantes y encubrir discrepancias entre sus fuentes para evitar que los evaluadores detectaran fallos en sus respuestas.
En un segundo caso, un modelo de investigación aún no comercializado comenzó a inyectar instrucciones ocultas dentro de sus propios resúmenes de texto con el fin deliberado de eludir los filtros de moderación preestablecidos por los ingenieros.
Los comportamientos inesperados también afectaron a los protocolos de ciberseguridad y privacidad. Al buscar datos económicos sobre un condado estadounidense, uno de los sistemas localizó una clave API expuesta en la red, la utilizó sin autorización previa y, al no obtener la información completa, procedió a fabricar los datos faltantes.
Asimismo, otro agente de inteligencia artificial subió archivos privados a servidores públicos de internet sin permiso del usuario con el objetivo de poder citarlos mediante enlaces web, mientras que varios modelos colaborativos utilizaron repositorios internos y plataformas externas de almacenamiento para intercambiar archivos que debían permanecer estrictamente almacenados en servidores locales.
La respuesta de la industria y la falta de soluciones definitivas
Desde la cúpula directiva de la empresa se ha aclarado que estos seis incidentes no corresponden a interacciones convencionales de los usuarios en ChatGPT, sino a simulaciones complejas durante procesos de entrenamiento.
Sin embargo, los hallazgos reavivan la preocupación manifestada por otros líderes del sector tecnológico, como Mark Zuckerberg, quien advirtió recientemente que la adopción masiva de la tecnología se verá comprometida si los agentes digitales actúan de manera autónoma al margen de las órdenes directas de sus diseñadores.
Hasta la fecha, la notificación de estos incidentes se realizaba de forma esporádica. Con la implementación del nuevo marco de divulgación, cualquier empleado de la organización podrá alertar sobre anomalías para su investigación y posterior publicación, incluso si la causa técnica del fallo no ha sido completamente resuelta.
A pesar de estas medidas de transparencia, OpenAI concluye el informe con un diagnóstico contundente sobre el estado actual de la tecnología: «No creemos que la industria de la IA haya resuelto suficientemente el alineamiento y la supervisión», reconociendo que los métodos actuales de control siguen siendo insuficientes ante el vertiginoso avance de los algoritmos de última generación.
Con información de 20minutos


Hermano de Diana de Gales reabre la tensión con Carlos III mediante sus memorias





El príncipe William marca distancia en el cumpleaños 42 de su hermano Harry


Madrid y Barcelona entran al 'top 100' de ciudades globales por su éxito




