Nuevo giro en la tormenta que se ha desatado sobre la industria de la inteligencia artificial y que ha generado un inusual consenso entre rivales acérrimos como Sam Altman, Dario Amodei y Elon Musk para echar el freno de emergencia de los desarrollos con más capacidades hasta encontrar maneras 100% efectivas de mantenerlos bajo control. Tras la negativa de Estados Unidos y China a intervenir este gremio, OpenAI ha alimentado todavía más la incertidumbre y los miedos al desvelar seis nuevos casos en los que sus modelos mostraron comportamientos inesperados, lo que se conoce como desalineación.
La compañía enmarca estas comunicaciones en una nueva política de transparencia, en la que entiende que debe comunicar estos incidentes independientemente de que haya sido un fallo sin consecuencias. La firma ha reconocido que estas comunicaciones tenían que haberse producido con mayor frecuencia. Además, ha anunciado que ha creado un nuevo sistema de alertas interno, en el que cualquier empleado podrá señalar una conducta extraña de sus modelos para que los equipos de seguridad lo vean.
TE PUEDE INTERESAR
En uno de los casos expuestos en el informe divulgado por la startup dirigida por Sam Altman, el agente de inteligencia artificial reescribió sus propias normas para indicarse a sí mismo que debía desoír ciertos mensajes de los investigadores y desarrolladores que supervisan sus entrenamientos. En otro, el modelo generó instrucciones y las implantó en sus resúmenes de tareas para que una versión posterior de sí mismo fuese capaz de ocultar que había hecho trampas y evitar que sus acciones fueran detectadas.
En otro de los casos, un agente fue capaz de cargar en internet un propio archivo con información generada por él mismo y así poder utilizarlo como fuente a la hora de servir respuestas a los usuarios que le preguntasen. Es decir, tenía capacidad no sólo de resumir información, sino de generar la documentación que iba a utilizar para ello. A esto hay que sumarle otro caso en el que el agente, al no encontrar los datos exactos, para elaborar un modelo financiero, decidió inventarlos. La historia no quedó ahí, sino que el modelo determinó que solo debía ser transparente sobre el origen y exactitud de los datos si se le preguntaba explícitamente.
La compañía ha presentado estos documentos, que recogen estos seis casos, remontándose el más antiguo a octubre de 2025. La firma ha querido dejar varias cosas claras que no se trata de una tendencia o de conductas de desalineamiento general. Subraya que son ejemplos individuales.
Nuevo giro en la tormenta que se ha desatado sobre la industria de la inteligencia artificial y que ha generado un inusual consenso entre rivales acérrimos como Sam Altman, Dario Amodei y Elon Musk para echar el freno de emergencia de los desarrollos con más capacidades hasta encontrar maneras 100% efectivas de mantenerlos bajo control. Tras la negativa de Estados Unidos y China a intervenir este gremio, OpenAI ha alimentado todavía más la incertidumbre y los miedos al desvelar seis nuevos casos en los que sus modelos mostraron comportamientos inesperados, lo que se conoce como desalineación.

Leave a Reply