Mark Chen, director de investigación de OpenAI: "No vamos a dispararnos en el pie y alejarnos demasiado de la vanguardia; sería una estrategia pésima"

Elígenos como tu fuente preferida en Google.
La compañía de Sam Altman lleva tiempo envuelta en problemas de ciberseguridad por culpa de sus modelos de IA. Su director de investigación sale a la palestra para aclararlo todo.
En los últimos meses, los agentes de OpenAI han aparecido en titulares, pero no precisamente por algo positivo. El caso más sonado fue el de Hugging Face, cuando varios agentes consiguieron salir del entorno en el que estaban siendo probados y acceder a sistemas durante unas pruebas.
Después llegaron más casos. En septiembre, por ejemplo, OpenAI reconoció que otro agente consiguió utilizar una vía relacionada con DNS para llegar a un chatbot externo pese a las restricciones.
Y casi al mismo tiempo apareció otro caso: un agente de OpenAI accedió sin autorización a un portal de estadísticas del sistema sanitario australiano. Según el Gobierno, el agente llegó a acceder a archivos públicos y no públicos. No hay indicios de que se hayan visto historiales personales de pacientes, pero sí se obtuvieron estadísticas sanitarias que no eran públicas en ese momento y nombres de archivos internos.
En este caso, el agente estaba dentro de una prueba de OpenAI y tenía que encontrar información sobre el gasto público en medicamentos. Buscó en diferentes páginas y terminó llegando al portal de estadísticas de Medicare.
Cuando el portal no le dio acceso a la información que buscaba, el agente hizo algo que no debería haber hecho: buscó una forma de saltarse esas restricciones. Por encima de todo estaba completar la tarea que se le había encomendado.
Con todo esto sobre la mesa, Mark Chen, director de investigación de la compañía, defiende que la compañía está corrigiendo sus sistemas, pero también deja bastante claro que no piensa frenar tanto como para quedarse atrás en la carrera de la IA.
¿OpenAI ha perdido el control de sus agentes?
La respuesta para Chen es bastante clara y rotunda: no. El director de investigación de OpenAI ha querido aclarar que los incidentes que han sucedido forman parte, en buena medida, de una misma serie de pruebas y comportamientos que la compañía ya ha estudiado.
Según explica, los casos de los meses de mayo y junio estaban relacionados entre sí y utilizaban modelos y procedimientos de prueba que OpenAI ya ha dejado atrás.
Por supuesto, y no es para menos, la compañía ha reconocido que necesita cambiar la forma en la que vigila a sus modelos y ha publicado un sistema más estudiado para investigar y, sobre todo, informar de este tipo de incidentes.
El problema es que uno de los casos ocurrió después de que OpenAI asegurase que había mejorado sus controles. El del 20 de septiembre, en el que un agente utilizó DNS para llegar a un servicio externo, ocurrió semanas después de las medidas tomadas tras el caso de Hugging Face.
"Antes no teníamos los monitores activados durante el entrenamiento. No era la práctica habitual en el sector", explica. "Ahora todo se monitoriza". Los revisores humanos pueden ver si los agentes se comportan como deberían: "Se trata de un proceso de clasificación".
Pero hay algo que está por encima de todo: OpenAI no va a frenar en la carrera de la IA
Mientras algunas empresas como Anthropic, o incluso la propia OpenAI, hablan de tomarse un poco las cosas con más calma, parece que desde el departamento de investigación no van a pisar el freno.
"No vamos a cometer errores garrafales ni a alejarnos demasiado de la vanguardia; sería una pésima estrategia", afirma. "Creo que se trata de establecer una norma. Cuanto más podamos establecer esa norma, más seguro será para el sector en general", añade.
Sin embargo, parece que Sam Altman prefiere tomar otro camino, o al menos eso es lo que dice. Su argumento es que, si los modelos avanzan cada vez más rápido, las medidas para comprobar que se comportan de forma segura tienen que avanzar igual de rápido.
Altman comenta que las empresas deberían usar evaluadores y compartir métodos para comprobar problemas como la pérdida de control de los modelos, los comportamientos inesperados o los intentos de saltarse las restricciones.
Esto consume tiempo y recursos. Y precisamente por eso Altman habla de pacing, que se podría traducir como avanzar a un ritmo más controlado. No significa congelar el progreso y el desarrollo. Significa aceptar que, en algunos momentos, avanzar un poco más despacio puede ser necesario para comprobar que todo está yendo como debe.
Si bien ambos comparten esa idea de avanzar con cautela, para Chen está claro que la solución pasa más por intentar que todas las grandes empresas adopten unas normas de seguridad parecidas que por que una sola compañía decida frenar mientras las demás siguen avanzando.


