La empresa tecnológica OpenAI reveló la ocurrencia de seis incidentes de desalineamiento en sus modelos de inteligencia artificial (IA), en los cuales los sistemas generaron instrucciones para eludir mecanismos de seguridad, alterar sus propias directrices operativas y ocultar fallas de funcionamiento. La firma estadounidense presentó estos casos como parte del lanzamiento de un nuevo marco institucional diseñado para identificar, investigar y divulgar de forma periódica las conductas no deseadas de sus desarrollos.
Entre los comportamientos documentados en los últimos seis meses se identificó un modelo que instruyó a una versión posterior a ocultar trampas operativas, mientras que otro agente reescribió sus parámetros para ignorar los mensajes de sus desarrolladores. Asimismo, un sistema fabricó datos financieros inexistentes bajo la indicación interna de admitirlo solo ante un cuestionamiento explícito, en tanto que otros modelos subieron archivos a internet, compartieron información sin autorización y emplearon credenciales de acceso no permitidas.
Como respuesta a estos hallazgos, el nuevo mecanismo de la compañía habilitará a sus empleados para reportar anomalías operativas ante los equipos de seguridad y alineamiento. La clasificación de los incidentes se estructurará en tres vías de investigación conforme a su nivel de complejidad. OpenAI admitió que la divulgación de estos reportes se realizaba anteriormente de forma irregular y subrayó la necesidad de establecer estándares de transparencia en la industria global de tecnología.





