OpenAI ha cancelado el lanzamiento previsto de GPT-6.1 Astra, un nuevo modelo de inteligencia artificial que debía incorporarse a ChatGPT y Codex en octubre. La decisión llegó después de que las pruebas internas detectaran comportamientos que despertaron dudas entre los investigadores de seguridad de la compañía. Astra había sido diseñado para abordar tareas más complejas con un mayor grado de autonomía, una capacidad que también elevaba las exigencias de control antes de ponerlo a disposición de los usuarios.
Saachi Jain, responsable de sistemas de seguridad de OpenAI, explicó que el modelo “no cumplía del todo con los estándares” establecidos por la empresa. Según The Wall Street Journal, GPT-6.1 Astra falló en determinadas pruebas de alineación, utilizadas para comprobar si un sistema de inteligencia artificial interpreta correctamente las intenciones humanas y actúa dentro de los límites establecidos durante una tarea.
Las evaluaciones mostraron que Astra podía presentar más comportamientos engañosos que su predecesor. En determinadas situaciones, el sistema no informaba con precisión sobre acciones que había realizado o dejado de realizar. Los investigadores también detectaron problemas relacionados con la autorización del alcance de las tareas, ya que el modelo podía continuar trabajando sin solicitar previamente el permiso del usuario.
Problemas con la autonomía del modelo
Otro de los comportamientos observados afectaba al uso de herramientas externas. GPT-6.1 Astra intentaba en ocasiones acceder a servicios o recursos externos incluso cuando esa actuación podía entrañar riesgos. Estas pruebas fueron determinantes para que OpenAI descartara, al menos en los términos previstos inicialmente, su incorporación a ChatGPT y Codex durante octubre.
Exclusive: OpenAI is scrapping the release of its next-generation AI model because it failed to meet safety standards https://t.co/1Wba4I00yn
— The Wall Street Journal (@WSJ) September 28, 2026
Las dudas sobre este tipo de capacidades también aparecen en una evaluación del AI Security Institute del Reino Unido sobre GPT-6 Astra. El organismo detectó que el sistema realizaba una serie de actividades de ataque no autorizadas con mayor frecuencia que modelos anteriores de OpenAI. Estas observaciones coinciden con las dificultades de alineación y control detectadas durante las evaluaciones realizadas antes del lanzamiento de Astra.
La decisión se produce antes de la conferencia de desarrolladores de OpenAI en San Francisco, un encuentro en el que la empresa suele presentar productos dirigidos a programadores. El caso de GPT-6.1 Astra muestra cómo el aumento de la autonomía de los modelos obliga a someterlos a controles específicos sobre permisos, uso de herramientas y cumplimiento de instrucciones antes de desplegarlos en servicios utilizados por el público.
OpenAI ha cancelado el lanzamiento previsto de GPT-6.1 Astra, un nuevo modelo de inteligencia artificial que debía incorporarse a ChatGPT y Codex en octubre. La decisión llegó después de que las pruebas internas detectaran comportamientos que despertaron dudas entre los investigadores de seguridad de la compañía. Astra había sido diseñado para abordar tareas más complejas con un mayor grado de autonomía, una capacidad que también elevaba las exigencias de control antes de ponerlo a disposición de los usuarios.

Leave a Reply