Microsoft lanza MAI-Cyber-1-Flash y reduce a la mitad el costo del MDASH en la búsqueda de vulnerabilidades

El primer modelo dedicado de Microsoft para ciberseguridad eleva al MDASH a 95,95% en el benchmark CyberGym, se iguala con el objetivo de Claude Mythos y reduce en 50% el consumo de GPT-5.4 en producción.
Microsoft lanzó el 27 de julio el MAI-Cyber-1-Flash, su primer modelo entrenado exclusivamente para ciberseguridad, e integró este dispositivo al MDASH, el arnés interno de identificación y remediación de vulnerabilidades. Con el nuevo modelo en lugar del trío anterior de GPT-5.4, GPT-5.4 mini y GPT-5.3 Codex, el MDASH marca 95,95% en el benchmark CyberGym y opera a la mitad del costo de la configuración anterior.
El MAI-Cyber-1-Flash es un transformer de mezcla esparsa de expertos con 137 mil millones de parámetros totales y 5 mil millones activos por token, con una ventana de contexto de 256 mil tokens. La empresa describe el modelo como un fine-tune de ciberseguridad del MAI-Code-1-Flash, que a su vez proviene de un checkpoint intermedio del MAI-Thinking-1. En la operación real, el MDASH permite que el Flash resuelva aproximadamente el 90% de las tareas y envía el 10% más difícil al GPT-5.4 de OpenAI. La mayor puntuación aislada del MDASH en CyberGym sigue viniendo de esta combinación híbrida, no del Flash solo.
El CyberGym, creado por investigadores de UC Berkeley, es una batería de 1.507 tareas que replican vulnerabilidades reales tomadas de 188 proyectos abiertos indexados por OSS-Fuzz. El agente recibe la descripción de la falla y el código base anterior al parche, y necesita generar un proof-of-concept que desencadene la misma condición. Es la métrica de referencia hoy para agentes de seguridad ofensiva, y el punto al que Microsoft apunta. Antes del anuncio, el récord público más alto era el de Anthropic con el Claude Mythos Preview, que reportó 83,1% en CyberGym en abril, aún no replicado por terceros de forma independiente.
El desplazamiento de mercado
Existen tres posibles interpretaciones del movimiento y la segunda es la más importante. La primera es de plumaje: 12 puntos porcentuales por encima de la mejor puntuación pública de Anthropic. La segunda es de infraestructura: Microsoft está demostrando que puede realizar inferencias con un MoE esparso de 5 mil millones activos que se igualan con modelos densos más grandes, con un corte real en el costo por token, y que el GPT-5.4 ahora se convierte en enrutamiento de excepción y no predeterminado. La tercera, más incómoda para Anthropic: en el eje en el que Dario Amodei posicionó el Claude, el de agentes autónomos que replican vulnerabilidades, surgió competencia de escala proveniente de la propia accionista mayoritaria en el lado empresarial.
El MAI-Cyber-1-Flash no estará disponible en Azure OpenAI abierto. Funciona en previsualización privada en Azure AI Foundry, restringido a clientes autorizados de MDASH. Es el mismo enfoque del Security Copilot de 2023: canalizar el modelo dentro del producto de seguridad, no vender API en crudo. Para el CISO comprador, la propuesta es operacional. Ganancia de costo real en lo ya contratado. Sin promesas de disponibilidad cruzada en otros productos Azure. Y sin indicación, en el material técnico divulgado, sobre la latencia del enrutamiento entre Flash y GPT-5.4, una métrica que comienza a importar para los pipelines de bug bounty automatizados que operan en ventanas de 30 minutos por CVE candidato.
El impacto excede a Redmond. Bancos estadounidenses que ejecutan bug bounty interno y utilizan MDASH como capa de filtrado comienzan a recibir el beneficio de costo sin modificar su contrato. Consultorías de seguridad en Alemania y el Reino Unido que revenden Defender for Cloud bajo marca blanca obtienen una ventaja competitiva frente a proveedores boutique que aún pagan integralmente por tokens de GPT-5.4. En Brasil, equipos SOC de grandes bancos privados que prueban AppSec asistida por LLM en fase de POC venían calibrando su presupuesto contra el precio del Claude Opus y del GPT-5.4. La tabla ahora ha cambiado, y el comprador tiende a pedir al proveedor de MSSP que realice el cruce de verificación con el MDASH antes de firmar el próximo ciclo.
Donde la matemática aún no cierra
Microsoft evita comparaciones directas entre el MAI-Cyber-1-Flash solo y el Mythos. El 95,95% en CyberGym es del MDASH completo, no del modelo por separado, y el enrutamiento hacia el GPT-5.4 en el 10% más difícil es precisamente lo que sostiene el techo de la puntuación. Sin esos 10%, el número disminuye. La comunicación de "primer modelo de ciberseguridad de Microsoft" tiene sentido en el gancho de marketing, pero el resultado técnico es de sistema, no de modelo. Es la distinción que separa una capacidad fundacional de una composición bien afinada, y regresará cuando otro proveedor intente replicar el benchmark de forma aislada.