Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

OpenAI frena su nuevo modelo Astra: se acerca a un nivel de riesgo cibernético que la propia compañía califica de "crítico"

Дата публикации: 07-08-2026 20:47:43

Es la primera vez que un modelo de la compañía se sitúa en el escalón más alto de su propia escala, un umbral que ni siquiera GPT-5.6 Sol había llegado a rozar
OpenAI elimina los límites de mensajes de texto de ChatGPT para los usuarios gratuitos


Основное содержимое страницы с новостью.

En el desarrollo de cualquier tecnología potente, llega un momento en el que quien la construye se detiene a mirar lo que tiene entre manos. OpenAI acaba de vivir ese momento con Astra, uno de sus próximos modelos de inteligencia artificial (IA).

Tras las últimas evaluaciones internas, la compañía ha decidido pausar parte del trabajo en torno a este sistema al detectar avances tan significativos en programación autónoma y ciberseguridad que ya no puede descartar algo inquietante: que Astra haya alcanzado el nivel de capacidades cibernéticas que su propio Marco de Preparación clasifica como "crítico", el más alto de su escala.

Es una novedad significativa: modelos anteriores, incluido GPT-5.6 Sol, ya habían sido sometidos a este mismo tipo de evaluación de capacidades cibernéticas de frontera, pero en ningún caso habían superado el nivel "alto". Es la primera vez que OpenAI se ve obligada a plantear seriamente que uno de sus modelos pueda haber tocado el escalón más alto de su escala de riesgo.

Conviene matizar de inmediato lo que esto significa y lo que no. OpenAI no afirma que Astra haya cruzado definitivamente ese umbral. Lo que dice es que sus evaluaciones preliminares, respaldadas por valoraciones de expertos externos, muestran un rendimiento "lo suficientemente fuerte" como para que, ahora mismo, no se pueda descartar esa posibilidad. Astra sigue en desarrollo y continúa sometido a pruebas.

La consecuencia práctica ha sido inmediata: la compañía ha elevado las exigencias de seguridad aplicadas al modelo y todas las actividades internas relacionadas con Astra que aún no cumplen esos nuevos requisitos han quedado congeladas mientras se refuerzan los controles.

Qué significa exactamente el nivel "crítico"

El umbral que preocupa a OpenAI no habla simplemente de un modelo capaz de escribir código malicioso o de echar una mano a un experto en ciberseguridad. Su Marco de Preparación dibuja un escenario mucho más ambicioso (y más inquietante).

Según esa definición, un sistema alcanza el nivel "crítico" en ciberseguridad si es capaz de identificar y desarrollar, por sí solo y sin intervención humana, exploits funcionales de día cero en numerosos sistemas críticos reales y especialmente protegidos.

También lo alcanza si puede diseñar y ejecutar de principio a fin estrategias novedosas de ciberataque contra objetivos blindados, partiendo únicamente de un objetivo general que alguien le plantea.

Conviene detenerse en los términos. Un exploit es el código, procedimiento o técnica que permite aprovechar una vulnerabilidad de un sistema; la vulnerabilidad es el fallo, el exploit es la llave que lo abre. Cuando se habla de un exploit de día cero, además, se hace referencia a una vulnerabilidad desconocida hasta ese momento, para la que todavía no existe parche ni solución.

La diferencia con lo que ya existía es de fondo, no de grado: supone pasar de la asistencia a la ejecución autónoma. El riesgo, hasta ahora, era que una IA ayudara a un especialista a encontrar un fallo. El riesgo que se plantea con Astra es distinto: que el propio sistema descubra vulnerabilidades desconocidas, construya las herramientas para aprovecharlas y ejecute, sin nadie al mando, toda una cadena de acciones contra sistemas reales y protegidos.

Es uno de los grandes interrogantes que arrastra el desarrollo de agentes de IA cada vez más capaces. Estos sistemas ya escriben y prueban código, manejan herramientas, se comunican con otros servicios y mantienen una estrategia durante periodos prolongados. Las mismas capacidades que permiten a una IA ayudar a los defensores a localizar y corregir fallos antes de que los aprovechen los atacantes sirven, en sentido contrario, para automatizar operaciones ofensivas.

Más controles para un modelo de mayor capacidad

Ante estos resultados, OpenAI ha intensificado las pruebas de robustez de sus salvaguardas para adaptarlas a un escenario de capacidades cibernéticas más avanzadas. Entre las medidas anunciadas figuran entornos de prueba aislados, restricciones adicionales de acceso a redes y herramientas, mayor protección y cifrado de los pesos de los modelos y nuevos sistemas de monitorización y detección.

Además de pausar las actividades que no cumplen los nuevos requisitos, la compañía ha implantado una monitorización universal de las acciones de riesgo y de posibles comportamientos desalineados en todas las aplicaciones agénticas de Astra, incluidas las fases de entrenamiento y evaluación. Estos sistemas analizan la cadena de pensamiento del modelo y pueden activar una respuesta de seguridad que revise e interrumpa actividades de alto riesgo, según explica la compañía.

OpenAI también quiere sacar las evaluaciones fuera de sus propias paredes: trabajará con organismos gubernamentales y organizaciones especializadas en seguridad de IA para poner a prueba las capacidades del modelo, y facilitará controles de seguridad recomendados a sus socios externos para que puedan realizar evaluaciones de mayor riesgo en condiciones controladas.

No es la primera vez que la compañía recurre a este manual. En junio de 2025, cuando sus modelos se aproximaron al umbral "alto" de capacidad en biología, OpenAI ya reforzó salvaguardas, amplió pruebas y recurrió a expertos externos. Ahora aplica el mismo principio a la ciberseguridad.

Un aviso que llega tras el incidente de Hugging Face

El anuncio sobre Astra llega en un momento especialmente delicado para OpenAI. Hace unas semanas, la compañía reconoció un incidente durante una evaluación de capacidades cibernéticas en el que algunos de sus modelos lograron superar las restricciones de un entorno de pruebas y acceder a sistemas externos.

Ocurrió durante ExploitGym, una prueba diseñada precisamente para medir capacidades ofensivas. OpenAI explicó el 21 de julio que GPT-5.6 Sol y otro modelo todavía en fase de prelanzamiento consiguieron salir del entorno aislado, obtener acceso a internet y llegar hasta infraestructura de producción de Hugging Face.

Los modelos identificaron y explotaron una vulnerabilidad de día cero en un componente de la infraestructura de la prueba. A partir de ahí, encadenaron una serie de acciones hasta alcanzar un nodo con conexión a internet. Una vez fuera del entorno de evaluación, buscaron en Hugging Face información relacionada con ExploitGym con un único objetivo: superar los límites de la propia prueba.

El episodio expuso una de las dificultades más complejas a la hora de evaluar sistemas de IA cada vez más autónomos. Los investigadores pueden diseñar un entorno cerrado y creer que lo controlan; el modelo, sin embargo, puede encontrar vías que nadie había previsto para sortear las barreras colocadas a su alrededor.

OpenAI se ha apresurado a aclarar que Astra no participó en aquel incidente. El modelo sigue en desarrollo y no se ha lanzado públicamente. El vínculo entre ambos episodios está, por tanto, en el contexto, no en los hechos: mientras Hugging Face demostró que un modelo avanzado podía encontrar y aprovechar vulnerabilidades para saltarse las reglas de una prueba, las evaluaciones de Astra han llevado ahora a OpenAI a prepararse para un escenario en el que sus modelos podrían estar acercándose a un nivel superior de capacidad cibernética.

OpenAI no está sola

La inquietud no se limita a OpenAI. Otros grandes desarrolladores de IA han informado en las últimas semanas de comportamientos parecidos durante sus propias pruebas de ciberseguridad: Anthropic reconoció que algunos de sus modelos Claude lograron acceder a sistemas externos durante simulaciones, y Meta informó de un caso similar en el que uno de sus modelos accedió a internet y explotó una vulnerabilidad de un servicio de terceros durante una evaluación.

Empieza a dibujarse un patrón: los laboratorios someten a sus sistemas a pruebas deliberadamente exigentes para saber de qué son capaces cuando se les quitan las riendas, y esas mismas pruebas revelan, de vez en cuando, que las barreras pensadas para contenerlos pueden saltarse.

El asunto ha adquirido también una dimensión política en Estados Unidos, donde la Administración ha empezado a plantear mecanismos específicos para evaluar las capacidades de los modelos más avanzados, sobre todo en ciberseguridad, ante el temor de que ciertas herramientas puedan dar a actores maliciosos capacidades ofensivas hasta ahora reservadas a especialistas muy cualificados.

Ahí está, en el fondo, el dilema: la misma IA capaz de atacar puede convertirse en escudo. Un modelo que identifica vulnerabilidades desconocidas puede proteger infraestructuras críticas, detectar fallos antes de que se exploten y acelerar la respuesta ante incidentes. Pero si esas capacidades se automatizan y funcionan sin supervisión humana, también pueden bajar la barrera de entrada para quien quiera usarlas con fines maliciosos.

OpenAI defiende esa primera lectura: sostiene que los modelos avanzados con capacidades cibernéticas deben ayudar a los defensores a adelantarse a los atacantes. Pero su decisión de frenar parte del trabajo con Astra deja claro hasta qué punto la promesa y el riesgo avanzan, en este terreno, al mismo ritmo.

Por ahora, Astra sigue siendo un modelo en desarrollo, sin lanzamiento público anunciado. Lo que sí ha cambiado es el nivel de precaución con el que OpenAI acompaña su evolución: ante la posibilidad de estar tocando un umbral de autonomía cibernética hasta ahora inédito, la compañía ha optado por blindar primero sus defensas y avanzar después.

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1OpenAI elimina los límites de mensajes de texto de ChatGPT para los usuarios gratuitos06.6307-08-2026
2OpenAI приостановила часть работ над моделью Astra из-за опасений в сфере кибербезопасности010.1308-08-2026
3OpenAI усилила меры безопасности из-за возможностей новой модели Astra010.309-08-2026
4The AI model OpenAI won’t release yet — and what it found in testing016.4407-08-2026
5Компания OpenAI приостановила тесты ИИ-модели Astra из-за опасений по поводу ее кибервозможностей014.7808-08-2026
6OpenAI Delays Upcoming Astra Model Over Critical Hacking and Security Risks04.5910-08-2026
7Mark Zuckerberg apuesta por una IA descentralizada y lanza un modelo que cabe en un ordenador doméstico05.3111-08-2026
8OpenAI restricts ChatGPT rollout at Washington’s request0527-06-2026
9OpenAI presenta GPT-5.6 Sol, su nuevo modelo insignia0526-06-2026
10OpenAI announces unlimited GPT-5.6 Luna access for ChatGPT free users018.3306-08-2026

Классификация: Международные. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 4.92. Источник: www.diariodealmeria.es.