OpenAI parece no controlar a sus agentes de IA. Esta ‘máquina’ promete atarlos en corto

Written by

in

Esa idea de echar el freno de mano y parar en seco el desarrollo de las inteligencias artificiales de vanguardia (o de frontera, como se dice en el gremio) que prácticamente suplicaron Dario Amodei y Sam Altman, entre otras grandes figuras de la, se está ejecutando de una forma un tanto extraña. La polémica de la recta final de la semana es que OpenAI ha despedido a tres investigadores de su unidad de seguridad. La cumbre de Trump con estos dos directivos, así como Sundar Pichai, Elon Musk o Mark Zuckerberg, se saldó con un marco ético voluntario y el gran titular fue que la tecnología de moda, a partir de ahora, se llamaría Súper Inteligencia. 

Mientras tanto, la industria no ha reducido la velocidad. Todo lo contrario. Los modelos les salen como churros. Hace dos años, los grandes laboratorios lanzaban uno nuevo cada dos meses y medio aproximadamente. Ahora mismo, Anthropic y OpenAI, los que lideran la carrera en EEUU, ponen uno en circulación cada 11 días. GPT-6.1 Sol llegó tan solo siete días después de GPT-6 Sol. 

Un ritmo casi tan endiablado como el ritmo al que se están conociendo los episodios en los que agentes de IA (esos que pueden hacer tareas sin supervisión para lograr la meta que se les ha encomendado) acabaron entrando donde no debían. La crisis empezó en verano con el archiconocido hackeo de Hugging Face, protagonizado por 1.200 agentes de OpenAI. Pero la lista no ha parado de engordar desde entonces. 

TE PUEDE INTERESAR

En las últimas semanas, se ha sabido que la Universidad de Nuevo México, de Toronto, de Iowa, entre otras, sufrieron capítulos similares. Más preocupación generó que webs del servicio de salud del Gobierno australiano, la SEC, el Departamento de Educación o la Oficina del Censo del Gobierno de Estados Unidos también se sumen al conteo de casos. 

Que los agentes accediesen a estos sitios y sistemas no significa siempre que haya una vulnerabilidad o que haya datos comprometidos. Hay veces que simplemente acudieron allí para consultar datos públicos o internos o utilizar herramientas para cumplir las misiones encomendadas de forma inesperada. Esto, según también se ha informado en los últimos días, es producto de que OpenAI dio demasiada manga ancha, técnicamente hablando, a sus agentes durante estas pruebas. 

Prácticamente, los grandes nombres del negocio de la IA, al menos en esta parte del mundo, han protagonizado descuidos de este tipo. OpenAI, Anthropic o Meta. Más recientemente, Google también hizo público un caso. Y se ha expandido la idea de que solo se conoce la punta del iceberg. 

Cuando toda la sociedad se pregunta qué hacer exactamente en lo que se refiere a la seguridad de la IA, las miradas se han acabado centrando en el rey de este negocio. Las miradas se han vuelto a posar en Jensen Huang, CEO de Nvidia, empresa más valiosa del mundo gracias a que sus gráficas y chips son el ingrediente secreto que necesita prácticamente cualquiera que quiera hacer carrera en lo de los grandes modelos. 

Un vigilante en un chip aparte

El ejecutivo estadounidense de origen taiwanés fue claro en la necesidad de presionar el botón del pánico. Desde el primer día defendió que no era necesario. Huang vino a defender que se trata de un problema de ingeniería y que se acabaría resolviendo. Más de uno y más de dos pensaron automáticamente que este desinterés por el intervencionismo y la regulación se debía más a primar la buena marcha de la multinacional californiana, a la que los inversores y los mercados le exigen cada tres meses romper sus techos de ingresos y beneficios para seguir sosteniendo su ingente valoración. Pero el directivo también lanzó una advertencia a Altman y Amodei en varias entrevistas e intervenciones públicas. “Si creen que su empresa está fuera de control, entonces que la controlen. Si no son capaces de hacerlo, habrá que cerrar los laboratorios”, llegó a afirmar. 

Ahora, la compañía que lidera ha dado un nuevo giro en esta historia y ha presentado una tecnología que, en caso de prosperar, podría reforzar aún más eso de ser una empresa vital para que esta revolución salga adelante. “El extraordinario potencial de la IA para la sociedad solo se materializará si resolvemos el problema de seguridad”, ha asegurado en los últimos días. Su propuesta para lograrlo se llama Open Agent Safety Platform, un despliegue técnico que busca atar en corto a estos programas antes de que vuelvan a colarse en la base de datos de algún ministerio o provoquen otro susto en una gran tecnológica.

El planteamiento técnico esquiva la ingenuidad de pretender que los agentes den siempre el resultado esperado cuando se les encarga algo. Hasta ahora, la contención se basaba en poner normas escritas dentro del propio software o filtrar las instrucciones, parches que cualquier usuario un tanto espabilado aprendió a reventar en cuestión de semanas. La receta de Nvidia pasa por lo físico, no solo el software. Es decir, atajar el problema desde la infraestructura, blindando el sistema operativo, las conexiones de red y las herramientas externas que maneja la máquina.

placeholder
El CEO de Nvidia, Jensen Huang. (Reuters)

El CEO de Nvidia, Jensen Huang. (Reuters)

Para entender cómo funciona este invento, conviene imaginar una celda de una prisión con un guardia armado en la puerta. En primer lugar, entra en juego OpenShell, un software que crea una caja cerrada alrededor del agente para que no pueda fisgonear fuera de los barrotes. Con ello, controla exactamente el material al que accede, qué archivos lee, qué bases de datos consulta y qué botones puede pulsar. Si la IA intenta saltarse esas normas o piratear su propia celda, entra en acción Sentry. Se trata de un vigilante adicional, que no vive en el procesador principal, sino en un chip independiente llamado BlueField. Al estar en un centro de mando diferente, esta salvaguarda en la sombra puede detectar cualquier movimiento raro y cortar la corriente o mandar a la IA que corresponda a cuarentena en cuestión de milisegundos, antes incluso de que la orden sospechosa llegue a ejecutarse.

Huang enmarca este lanzamiento en un esfuerzo colectivo que no puede demorarse y debe seguir el ritmo acelerado del lanzamiento de los modelos más capaces. “A medida que seguimos explorando los límites de la IA, debemos acelerar los descubrimientos en la frontera de la seguridad de la IA”, declaró en una entrevista con motivo de este lanzamiento. 

Sobre el papel, la jugada tiene sentido. Se trata de un entorno de confianza cero donde cada agente se identifica y se le vigila y se escruta cada paso. La idea de apoyarse en un chip externo permite que la plataforma pueda aislar rápidamente el problema presionando, por así decirlo, un diferencial. Además, el software es de código abierto y compatible con sistemas y chips de otras compañías, lo que apacigua, en parte, los clásicos temores de abuso de poder y de querer que todos los caminos conduzcan a su cuenta de resultados.

La letra pequeña, sin embargo, deja claro que nadie regala nada. La protección pata negra, la que frena al agente en seco a nivel de circuito integrado mediante Sentry, exige pasar por caja. Hay que comprar sus tarjetas BlueField, lo que empuja de cabeza al cliente a depender de su ecosistema si busca el máximo nivel de blindaje. Tampoco es una receta milagrosa para cualquier empresa, ya que coordinar semejante estructura añade dificultades tanto técnicas como económicas que no todos pueden permitirse.

El gran asterisco de este movimiento es que no soluciona el problema de fondo del razonamiento artificial. La propuesta de Huang es un bozal de ingeniería de primer nivel, pero un bozal al fin y al cabo, diseñado para frenar desmanes en la ejecución física sin meterse en lo que lleva al modelo a ofrecer un comportamiento inesperado, que es lo que está preocupando a los laboratorios.

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *