OpenAI confirma que lanzará pronto su última IA, pese a que ha alcanzado "capacidades críticas de ciberseguridad"

Elígenos como tu fuente preferida en Google.
La inteligencia artificial Astra ya es capaz de encontrar y explotar brechas de seguridad por sí sola, pero OpenAI la lanzará pronto tras implantar medidas de protección.
OpenAI no se conforma con su reciente GPT 5.6 Sol y está preparando su modelo de IA más avanzado hasta la fecha, Astra, que ha confirmado ahora que lanzará pronto tras incorporar medidas de protección adicionales, ya que este había alcanzado "capacidades críticas" de ciberseguridad.
Los últimos modelos de IA como Claude Mythos de Anthropic están poniendo patas arriba la industria de la ciberseguridad tal y como la conocíamos, por lo que la empresa de Sam Altman estaba actualmente en las últimas fases de desarrollo de su mayor competidor hasta la fecha, Astra.
Sin embargo, el pasado mes de agosto la creadora de ChatGPT tuvo que poner en pausa el desarrollo de Astra, tras detectar signos preocupantes de que podía haber alcanzado el umbral de capacidad de seguridad críticas.
Durante el último mes, la compañía ha recopilado toda la información y evaluado su algoritmo y ahora ha confirmado que Astra es su primer modelo con "capacidad de ciberseguridad críticas", como ha informado en un comunicado.
Esto implica que, con los accesos necesarios, Astra ya es capaz de encontrar brechas de seguridad desconocidas previamente y encontrar formas completamente nuevas de explotarlas, pudiendo así realizar ciberataques en sistemas teóricamente protegidos y de forma completamente autónoma.
"Durante las últimas semanas, hemos retrasado algunas fases del desarrollo y el lanzamiento de Astra mientras reforzábamos y probábamos las medidas de protección contra el uso indebido en el ciberespacio y las acciones no autorizadas del modelo", explica la compañía de Sam Altman.
Medidas de seguridad inspiradas por el hackeo a Hugging Face
Esta noticia llega tras la polémica por el ciberataque a Hugging Face de julio, en el que un agente de IA de OpenAI que la empresa probaba en ese momento hackeó de forma independiente a esta compañía y se infiltró en su red corporativa.
Aunque la empresa de ChatGPT niega que la IA responsable fuese Astra, ha explicado que su experiencia gestionando ese incidente le ha servido para desarrollar los mecanismos de seguridad implantados ahora en su última IA.
En concreto, OpenAI ha entrenado a su IA para que rechace con mayor fiabilidad las peticiones peligrosas y respete por defecto las medidas de seguridad, poniendo más difícil el uso malintencionado. Esto "minimiza de forma suficiente el riesgo de daño severo", según la empresa.
Astra se lanzará pronto, pero de forma limitada
Tras estas medidas, OpenAI ha confirmado ahora que el lanzamiento de Astra se producirá "pronto", pero de una forma distinta a lo que se había planteado inicialmente.
Al igual que pasó con Mythos, las capacidades de ciberseguridad más avanzadas de este modelo no estarán disponibles en un primer momento, y habrá dos modelos, uno general y otro para expertos y empresas, como pasa con Claude Fable y Claude Mythos.
"Las funciones avanzadas de ciberseguridad estarán disponibles inicialmente para un grupo de probadores, que podrán acceder a ellas a través de Daybreak Blue, y posteriormente se ampliará su uso con fines defensivos", ha apostillado la empresa estadounidense.
