Astra se convierte en el primer modelo de OpenAI en cruzar el umbral 'Critical' en ciberseguridad

OpenAI anunció este martes (2) que Astra es el primer modelo de la casa en alcanzar el nivel 'Critical' de su Preparedness Framework. 100% en ExploitBench y dos zero-days encontrados solo forzaron el gating de acceso.
OpenAI comunicó el 2 de septiembre que Astra es el primer modelo de la casa en cruzar el umbral 'Critical' en capacidades cibernéticas según el Preparedness Framework, el marco interno de riesgo que la compañía adopta desde 2023. La clasificación, reservada a sistemas capaces de identificar y explotar vulnerabilidades zero-day en objetivos endurecidos sin dirección humana paso a paso, llega junto a una decisión comercial: Astra irá a producción en breve, pero las funciones más sensibles estarán restringidas a un pequeño grupo de socios a través del programa Daybreak Blue.
La clasificación se sostiene en una batería de pruebas internas que OpenAI describió en detalle. En ExploitBench, benchmark de desarrollo de exploits a partir de vulnerabilidades conocidas, el modelo puntuó 100%. En una segunda prueba, con 20 vulnerabilidades de alta severidad divulgadas entre junio y agosto de este año, Astra descubrió y utilizó dos zero-days como parte de una cadena de explotación completa. En evaluaciones de jailbreak cibernético, rechazó el 91.5% de las solicitudes maliciosas, frente al 59% del GPT-5.6 Sol en el mismo conjunto.
La empresa detuvo el desarrollo en agosto para agregar capas de monitoreo, controles de contención y formación adicional. Según comunicaciones de OpenAI, Astra ahora cuenta con detectores de jailbreak, evaluaciones de fuga de sandbox y monitoreo de la cadena de razonamiento. Gobiernos y grupos externos de seguridad serán involucrados en las próximas pruebas, una señal de que la compañía busca capturar validación institucional antes de la liberación amplia.
Por qué 'Critical' cambia la conversación
La etiqueta no es comercial, es operacional. Para un CISO que ya opera bajo la Orden Ejecutiva americana sobre IA y bajo el AI Act europeo (ambos exigen evaluaciones antes de que los sistemas de frontera entren en producción), la llegada de un modelo clasificado en el nivel máximo de su propio proveedor anticipa el guion del regulador. El Departamento de Comercio de EE. UU. ya mantiene acuerdos de acceso anticipado con OpenAI y Anthropic desde 2024, y la Oficina de IA europea pasó a tener base para exigir evaluaciones equivalentes bajo el Artículo 51 del AI Act, cuya segunda ola de obligaciones entró en vigor el 2 de agosto.
El acceso a través de Daybreak Blue reproduce un patrón que Anthropic venía utilizando con el Claude Mythos: las capacidades ofensivas quedan con un subconjunto verificado, las capacidades defensivas van al mercado. Es una respuesta práctica al riesgo de asimetría, pero crea una nueva asimetría comercial. Firmas de red team con contrato activo pasan a tener acceso a herramientas de frontera que competidores menores no tendrán.
Dónde aparece el efecto
Dos mercados sentirán pronto. En Estados Unidos, proveedores como Mandiant, CrowdStrike y la propia Palo Alto Networks deben posicionarse inmediatamente en Daybreak Blue para no perder terreno en pentest gestionado; contratos federales bajo el Cybersecurity National Action Plan ya premian a operadores que traen modelos con red-team certificado. En Alemania, el BSI señaló que cualquier producto de análisis ofensivo usado en infraestructura crítica requerirá auditoría de origen, lo que juega en contra de plazos cortos de rollout y transfiere riesgo a proveedores locales como T-Systems.
Unit 42, el brazo de respuesta a incidentes de Palo Alto Networks, publicó el mismo día datos que refuerzan la inquietud: el 25% más rápido de los incidentes que la firma investigó en 2025 llegó a la exfiltración en 72 minutos, frente a los 285 minutos del año anterior. Si un modelo 'Critical' pasa a estar disponible para un adversario de competencia operativa media, la ventana para la detección se estrecha aún más.
El contrapunto que necesita mantenerse
Analistas que siguen benchmarks de seguridad de IA recuerdan que ExploitBench y pruebas internas derivadas son fabricados por el propio laboratorio y no sustituyen la exposición controlada en entornos en vivo. El rendimiento del 100% en un conjunto que OpenAI diseñó es, al mismo tiempo, un argumento a favor de la clasificación y un objetivo natural de escrutinio: ningún consejo tendrá comodidad con métricas así hasta que evaluadores externos publiquen replicaciones. Fue por esta razón que Anthropic empezó a divulgar sus informes de red-team antes del lanzamiento, y Astra deberá ser exigido por el mismo camino.
Qué observar en las próximas semanas
Tres hitos importan. Primero, si la Oficina de IA europea va a exigir evaluación bajo el Artículo 51 antes de la liberación en la UE, lo que retrasaría la distribución regional. Segundo, qué nombres entran en la lista Daybreak Blue: cualquier ausencia notable de una Big Tech asiática sería un dato geopolítico, no solo comercial. Tercero, si Anthropic responde publicando clasificación equivalente del Mythos 5.1, lo que forzaría una comparación lado a lado que hoy el mercado no tiene.