GPT-6 Astra sorprende con benchmarks espectaculares, pero no todas las evaluaciones son tan positivas. Analizamos sus resultados.[…]
La entrada GPT-6 Astra, en detalle: ¿Es el modelo más potente del mercado? Esto dicen los benchmarks (y los expertos) se publicó primero en Marketing4eCommerce.
Pocas veces se había generado tanto hype en el mundo de la IA (bastante proclive al hype, por cierto), como con la anunciada llegada de Astra, el nuevo GPT 6 de OpenAI. De hecho, en los días anteriores, distintas voces habían advertido de que estábamos ante una pequeña revolución en la carrera armamentística de la inteligencia artificial, y de hecho Sam Altman había explicado que se trataría de “un paso significativo hacia adelante tanto en capacidades como en alineamiento”.
Ahora, Astra ya ha comenzado a desplegarse, y no paran de llegar reacciones al respecto.
La primera, claro, del propio Sam Altman, nada más lanzarse el nuevo modelo:
“GPT-6 Astra ya está aquí. Esperamos que impulse una nueva generación de emprendimiento, descubrimientos científicos y creación. Creemos que es el mejor modelo del mundo para el uso de computadoras, el trabajo profesional, la ciencia, la programación, la ciberseguridad y más. Nos tomó algo más de tiempo garantizar el cumplimiento de los estándares de seguridad y alineación requeridos para este nivel de capacidad, pero creemos que la espera habrá valido la pena. Obtiene una puntuación del 98 % en FrontierMath (Nivel 4), del 99,9 % en ARC-AGI 3 y del 100 % en ExploitBench”.
En general, las reacciones han sido elogiosas de parte de algunos de los principales expertos y divulgadores en IA de todo el mundo, como el español Carlos Santana (@dotCSV), que mostraba su asombro por la valoración de GPT 6 en algunos de los principales benchmarks que había desvelado OpenAI en el lanzamiento: “De los benchmarks que acompañan, el más impresionante es el de ARC-AGI 3 donde GPT-6 parece saturar por completo el benchmark!! El salto respecto a GPT-5.6 Sol es de pasar del 7.8% a superarlo por completo. WOW”
De hecho, el propio Santana se queda asombrado con las habilidades de GPT 6 en el campo de las matemáticas o el razonamiento: “El salto en capacidades del modelo es tal que sin usar cadenas de razonamiento (es decir, el modelo instantáneo) consigue resolver tareas que a un humano le llevaría unos 30 minutos con un 50% de efectividad, saltando desde los 4 minutos logrado por Sol 5.6!”
Pero Santana no había podido probar todavía Astra y, como decía, se basaba en los benchmarks publicados por la propia OpenAI, que puedes consultar aquí.
Sin embargo, hay especialistas que sí pudieron dar impresiones de primera mano.
Allie K. Miller, empresaria y especialista de larga trayectoria en el campo de la IA sí tuvo acceso anticipado a GPT 6, y publicó una larga opinión al respecto al poco de lanzarse: “El uso de computadora y navegador son simplemente increíbles. Estoy segura de que prácticamente cualquier flujo de trabajo estable realizado en una computadora puede ser al menos parcialmente realizado por IA. Es simplemente tan tan bueno…”.
En cualquier caso, también había espacio para rebajar ligeramente las expectativas, explicando que “falló en mis desafíos de juegos de palabras complejos. Ningún modelo lo ha superado aún” y “otros probaron mucho en torno a 3D y animaciones. Yo no, pero parecen muy contentos con los resultados. Vi sus resultados y no quedé tan impresionada, pero está bien (…) Probablemente seguiría yendo a Fable 5.1 para pedidos de tipo “construcción de mega arquitecto”.
Por su parte, el diseñador y fundador de Pen.dev Tom Krcha, explicaba a través de este tuit y este vídeo su experiencia con el diseño 3D en Astra:
Inmensas capacidades para diseño, matemáticas y tareas agénticasI had an early access to GPT-6 Astra and I can say, everyone in the world now has a 3D designer at their fingertips.
I gave it an image of a house and asked to create it in 3D with all the details including toys, appliances and furniture. This a full 3D model reconstruction in… pic.twitter.com/VuBOPQH0Ht— Tom Krcha (@tomkrcha) September 3, 2026
Como ves, la mayor parte de los halagos que ha recibido GPT 6 hasta el momento mencionan campos como su increíble habilidad para la resolución de problemas matemáticos complejos, el desarrollo de tareas agénticas y, como señalaba Krcha, sus capacidades en el modelado en tres dimensiones.
Desarrolladores y diseñadores destacan su habilidad en la generación de entornos 3D, código CAD (BenchCAD) y pequeños videojuegos jugables. Así, por ejemplo, la startup de videojuegos Playco probó Astra creando tres prototipos de videojuegos y afirma que la mayoría funcionaron al primer intento, necesitando un 50% menos de correcciones manuales que el modelo anterior.
Y bueno, también está el tema de la seguridad.
Astra es el primer modelo de OpenAI que alcanza el nivel crítico en ciberseguridad bajo su Preparedness Framework. Según OpenAI, sin las protecciones de producción puede encontrar vulnerabilidades desconocidas y desarrollar formas de explotarlas en sistemas bien protegidos. Durante las evaluaciones, Astra descubrió y utilizó dos vulnerabilidades zero-day que no se conocían previamente… y que OpenAI está comunicando a sus responsables.
Además:
En cualquier caso, no todas las pruebas sitúan a Astra tan claramente por encima de sus rivales.
Una de las referencias en el sector es Artificial Analysis, una plataforma independiente que ya ha publicado sus primeras evaluaciones sobre el modelo. En su índice de referencia, el Intelligence Index v4.1.1, GPT 6 obtiene 61,2 puntos, apenas tres décimas más que GPT-5.6 Sol (60,9) y por debajo de su rival de Anthropic, Claude Fable 5.1 (65,7).
Es decir, Astra casi empata con su predecesor y queda cinco puntos por debajo de Fable 5.1. Además, también queda por detrás del nuevo Muse Spark 1.3, que acaba de lanzar Meta. Una buena muestra de que los resultados extraordinarios publicados por OpenAI en determinadas pruebas no significan que Astra domine automáticamente todos los benchmarks disponibles.
Mucho más eficiente en tareas agénticas, más caro para el restoEn cualquier caso, donde sobresale Astra es en determinadas pruebas agénticas de programación, especialmente teniendo en cuenta su eficiencia.
Así, en el Artificial Analysis Coding Agent Index, Astra consigue 67 puntos, aproximadamente igualando a Claude Fable 5 y Opus 5 y algo por detrás de Fable 5.1. La gran diferencia es que Astra utiliza aproximadamente un tercio de los tokens de GPT-5.6 Sol a máximo esfuerzo, lo que supone una reducción cercana al 70%. Frente a Opus 5, utiliza aproximadamente una quinta parte.
Este salto en la eficiencia sirve para compensar el importante aumento del precio de Astra, cuyos tokens cuestan 2,5 veces más que los de Sol. En las tareas de programación evaluadas, Astra tiene aproximadamente el mismo coste por tarea que GPT-5.6 Sol, pero obtiene dos puntos más en el benchmark. Frente a Claude Fable 5, la diferencia es todavía mayor: consigue una puntuación similar con menos de la mitad del coste por tarea.
La situación es muy distinta en el Intelligence Index. Aquí Astra también es más eficiente que Sol, pero la mejora es menor, porque utiliza aproximadamente un 10% menos de tokens de salida por tarea. Esta reducción no consigue compensar su mayor precio y, como resultado, Astra resulta alrededor de un 75% más caro por tarea que Sol a máximo esfuerzo, pese a obtener prácticamente la misma puntuación.
Artificial Analysis también detecta una gran reducción de las alucinaciones y mejoras en trabajos profesionales de larga duración, aunque encuentra llamativos retrocesos en otras pruebas de tareas profesionales, programación científica, atención al cliente y razonamiento sobre contextos largos.
Entonces… ¿cuándo lo podremos probar?Me temo que por ahora, GPT 6 no está disponible para todo el mundo. OpenAI comenzó ayer el despliegue a un conjunto limitado de empresas y ha explicado que durante los próximos días llegará a ChatGPT Plus, Pro, Business y Enterprise, además de API y Azure.
Seguro que ya tienes ganas de probarlo.
Imagen: ChatGPT