Estrategia6 minRedacción

OpenAI lanza GPT-6 Astra, menciona AGI y cobra US$ 10 por millón de tokens de entrada

Corredor de data center à noite com um único engenheiro em frente a um notebook, luz âmbar de alerta ao fundo.

El modelo se estrenó el 3 de septiembre con lanzamiento escalonado, tabla de precios igual a la de Claude Fable 5.1 y un récord en benchmarks que el mismo Brockman llamó salto generacional.

OpenAI lanzó el GPT-6 Astra el 3 de septiembre con una promesa que no había hecho desde el debut del GPT-4: que el modelo podría, en algún momento, ser visto como el hito de llegada de la inteligencia artificial general. Greg Brockman, presidente de la compañía, calificó el lanzamiento como un "salto generacional" y dijo que Astra es el resultado de "años de investigación y grandes apuestas". La liberación comenzó con un conjunto restringido de organizaciones en el programa de ciberseguridad de la empresa, con escalonamiento para clientes de ChatGPT Plus, Pro, Business y Enterprise, además de la API y de AWS a lo largo de los próximos días.


El precio público en la API es de US$ 10 por millón de tokens de entrada y US$ 50 por millón de tokens de salida en modo Standard, con un modo Fast que duplica la velocidad y el precio. Es el mismo rango cobrado por Anthropic en el Claude Fable 5.1, lanzado dos días antes, y alrededor de 2,5 veces el precio promocional del GPT-5 Sol. La convergencia de precios entre los dos mayores laboratorios cierra, en la práctica, el ciclo de dumping agresivo que dominó el primer semestre.


Benchmarks saturados y la advertencia del evaluador


OpenAI reivindica 97,6% en FrontierMath Tier 4, 99,9% en ARC-AGI-3 y 100% en ExploitBench. Los números son importantes porque ambas pruebas fueron diseñadas para mantenerse por delante de la capacidad de modelos de frontera: saturarlas señala algo cualitativamente diferente de superar una tabla de clasificación convencional. Sin embargo, la lectura viene con un asterisco. Epoch AI, que mantiene el FrontierMath, informó que OpenAI financió el desarrollo de la prueba y tiene acceso exclusivo a parte de los problemas. Y el 99,9% en ARC-AGI-3 depende de un harness estatal y caro; llamadas sin estado a través de API ofrecen puntuaciones inferiores, en torno al 98,6% según diferentes configuraciones.


Sin estas matices, el comunicado se lee como una carrera ganada. Con ellas, el panorama es diferente: Astra está en la cima de la tabla en razonamiento, ingeniería de software, uso de computadora y ciberseguridad, pero el "casi perfecto" necesita ser leído dentro de los límites que los propios evaluadores imponen. Al Jazeera clasificó el lanzamiento como un acontecimiento "en medio de un escrutinio creciente", en referencia a las alertas recientes de reguladores europeos y americanos.


Daybreak entra en escena junto


OpenAI lanzó el mismo día el programa Daybreak for Frontline Defenders, con US$ 1 mil millones en créditos subsidiados de acceso a los modelos Daybreak de ciberseguridad, capacitación y asociaciones dirigidas a operadores de servicios esenciales. El anuncio simultáneo no es una coincidencia: Astra se describe como de última generación en ciberseguridad y la compañía sabe que colocar un modelo capaz de detectar zero-days en manos de cualquier pagador invita a un escrutinio regulatorio inmediato. Vincular el lanzamiento a una iniciativa defensiva es la respuesta estructurada.


Lectura para clientes corporativos en EE. UU. y en el Reino Unido


Para el CIO norteamericano, la decisión práctica es saber si se reemplaza Claude Fable 5.1 por Astra en los pipelines de código, dado que el precio es igual. La respuesta depende del peso relativo del razonamiento matemático (donde Astra salió adelante) frente a la latencia agente-a-agente y uso de herramientas (donde Anthropic mantiene un tiempo de experiencia más largo). En el Reino Unido, la Financial Conduct Authority ya ha señalado que exigirá evidencia de evaluación independiente antes de aprobar despliegues de frontera en bancos regulados, y la exclusividad parcial de OpenAI en FrontierMath tiende a convertirse en munición para que los oficiales de cumplimiento soliciten la externalización de benchmarks.


Hay un efecto secundario más inmediato: el Gemini 3.1 Pro, de Google, lanzado en febrero con contexto de 1 millón de tokens, dejó de ser el modelo con mejor atractivo agente en varias evaluaciones. La ventana en la que Sundar Pichai pudo argumentar liderazgo en benchmarks de razonamiento se cerró. El próximo movimiento de Google, esperado antes del final del trimestre, definirá si la paridad triple entre OpenAI, Anthropic y Google se consolida o si uno de los tres vuelve a destacar en precio, y no en capacidad.

El análisis de la semana, por correo

Una edición semanal con lo que importa a quien decide. Sin anuncios, sin patrocinio.

Cancelación en un clic, cuando quieras.

Estrategia