¿Qué es GPT-Red, el modelo superhacker secreto de OpenAI?

Qué es GPT-Red
Qué es GPT-RedGenerada con IA / Computer Hoy
Noticia
Añádenos en Google

Elígenos como tu fuente preferida en Google.

En lugar de esperar a que investigadores o hackers encuentren errores una vez que un modelo ya está publicado, OpenAI quiere adelantarse a todo con GPT-Red.

Una inteligencia artificial cuyo único objetivo sea intentar hackear a otras inteligencias artificiales. Suena un tanto extraño, pero eso es exactamente lo que ha creado OpenAI con GPT-Red, un modelo que, al menos en un principio, nunca llegará al público y que ha sido creado para encontrar fallos de seguridad antes de que lo hagan los ciberdelincuentes.

A diferencia de ChatGPT o de otros modelos de la compañía, GPT-Red no responde preguntas ni ayuda a programar. Su trabajo consiste en actuar como un superhacker: intenta engañar a otros modelos de IA, saltarse sus restricciones y descubrir vulnerabilidades que podrían ser aprovechadas por un ciberdelincuente. 

Solo cuando consigue romper sus defensas, los ingenieros pueden corregir esos fallos antes de lanzar el modelo al público. Puede parecer una idea un tanto rara, pero ciertamente tiene todo el sentido del mundo.

¿Qué es GPT-Red?

GPT-Red es un modelo de lenguaje especializado en red teaming, una técnica utilizada desde hace años en ciberseguridad que consiste en atacar un sistema para descubrir sus puntos débiles antes que un atacante real.

Normalmente, este trabajo lo hacen expertos humanos que intentan romper las defensas de un programa buscando errores, vulnerabilidades o formas raras de hacerlo fallar. El problema es que este proceso requiere mucho tiempo y resulta casi imposible de escalar cuando los propios modelos de IA mejoran tan rápido y se usan para los ataques.

Para resolver ese problema, OpenAI decidió crear un modelo capaz de hacer ese trabajo de forma automática. En lugar de responder preguntas como ChatGPT, GPT-Red tiene un único objetivo: encontrar la manera de engañar a otros modelos.

Su especialidad son los llamados ataques de inyección de prompts (prompt injection). Consisten en dar instrucciones ocultas dentro de documentos, páginas web, correos electrónicos o cualquier otro contenido que una IA pueda leer para conseguir que se salte sus instrucciones y haga algo que nunca debería hacer, como dar información confidencial, modificar datos o realizar acciones que no debería.

¿Cómo aprende a convertirse en un "superhacker"?

GPT-Red no fue entrenado con una lista de ataques escritos por personas. OpenAI utilizó una técnica llamada autojuego (self-play). En lugar de enfrentarlo a hackers humanos, lo puso a competir todo el tiempo contra otros modelos de inteligencia artificial.

Como realmente funciona, recuerda mucho al entrenamiento de programas como AlphaGo o AlphaZero. Un modelo intenta atacar mientras el otro intenta defenderse. 

Cada vez que el atacante encuentra una nueva forma de romper las defensas, recibe una recompensa durante el entrenamiento. Al mismo tiempo, el modelo atacado aprende a protegerse frente a ese nuevo método.

Después de miles y miles de enfrentamientos, ambos mejoran todo el tiempo. Además, según las pruebas, GPT-Red demostró ser muy persistente. Cada vez que encontraba un pequeño fallo, lo probaba una y otra vez de formas distintas hasta dar con la mejor forma de romper el sistema de su rival.

Pero esto no es todo y, para realmente ver de qué era capaz, en OpenAI lo pusieron a prueba repitiendo un examen que varios expertos humanos hicieron en 2025 sobre una versión antigua de GPT-5.

El resultado fue que GPT-Red encontró más fallos y más rápido que los profesionales humanos. En concreto, este modelo superhacker consiguió saltarse sus defensas el 90% de las veces.

Sin embargo, al probar esos mismos ataques contra el nuevo GPT-5.6, la tasa de éxito bajó a menos del 23%, demostrando que esto no solo va de encontrar fallos sino de que los modelos también aprendan a protegerse.

También lo probaron contra Vendy, una inteligencia artificial que gestiona máquinas expendedoras de refrescos, y logró hackearla para cambiar los precios de las bebidas y cancelar pedidos de clientes.

¿Podrás algún día utilizar GPT-Red?

Parece que la respuesta es que no. Esta IA ha sido entrenada para algo que poco tiene que ver con el usuario de a pie. OpenAI ha confirmado que permanecerá como una herramienta solo para uso interno.

En su lugar, lo que llegará al público serán los resultados de su trabajo: modelos más resistentes, con menos vulnerabilidades y mejor preparados para soportar intentos de manipulación.

Ver sus artículos

Carolina González

Redactora

Carolina González, redactora de actualidad, reportajes a fondo, análisis de todo tipo de productos y vídeos para el canal de Youtube.