Hauptanalyse
Strategie5 Min.

Microsoft bringt MAI-Cyber-1-Flash auf den Markt und halbiert die Kosten des MDASH zur Auffindung von Schwachstellen

Analista de segurança de costas em frente a monitor curvo mostrando código com diffs verdes, ao lado de xícara vazia de espresso e planilha impressa com anotação circulada em vermelho.

Das erste von Microsoft speziell für Cybersicherheit entwickelte Modell erreicht im CyberGym-Benchmark 95,95 % und reduziert den Verbrauch von GPT-5.4 in der Produktion um 50 %.

Microsoft hat am 27. Juli den MAI-Cyber-1-Flash, sein erstes Modell, das exklusiv für Cybersicherheit trainiert wurde, vorgestellt und ihn in den MDASH integriert, das interne System zur Identifizierung und Behebung von Schwachstellen. Mit dem neuen Modell anstelle des vorherigen Trios aus GPT-5.4, GPT-5.4 mini und GPT-5.3 Codex erzielt der MDASH 95,95 % im CyberGym-Benchmark und funktioniert zu den halben Kosten der vorherigen Konfiguration.


Der MAI-Cyber-1-Flash ist ein Transformer mit sparse mixture of experts, der über insgesamt 137 Milliarden Parameter und 5 Milliarden aktive Parameter pro Token verfügt, sowie ein Kontextfenster von 256.000 Tokens. Das Unternehmen beschreibt das Modell als eine Feinabstimmung für Cybersicherheit des MAI-Code-1-Flash, das wiederum von einem Zwischencheckpoint des MAI-Thinking-1 ausgeht. In der tatsächlichen Anwendung lässt der MDASH den Flash etwa 90 % der Aufgaben erledigen und sendet die 10 % schwierigeren Aufgaben an den GPT-5.4 von OpenAI. Der höchste isolierte Score des MDASH im CyberGym stammt weiterhin aus dieser hybriden Kombination, nicht nur vom Flash allein.


Der CyberGym, entwickelt von Forschern der UC Berkeley, ist eine Sammlung von 1.507 Aufgaben zur Reproduktion von echten Schwachstellen aus 188 Open-Source-Projekten, die vom OSS-Fuzz indexiert werden. Der Agent erhält die Beschreibung des Fehlers und den Code vor dem Patch und muss einen Proof-of-Concept generieren, der denselben Zustand auslöst. Es ist die heutige Referenzmetrik für offensive Sicherheitsagenten, und das Ziel, auf das Microsoft abzielt. Vor der Ankündigung war der höchste öffentliche Wert der von Anthropic mit dem Claude Mythos Preview, der im April 83,1 % im CyberGym berichtete, aber noch nicht von Dritten unabhängig reproduziert wurde.


Die Marktentwicklung


Es gibt drei mögliche Interpretationen der Bewegung, und die zweite ist am wichtigsten. Die erste ist eine plumage: 12 Prozentpunkte über dem besten öffentlichen Score von Anthropic. Die zweite bezieht sich auf die Infrastruktur: Microsoft zeigt, dass es möglich ist, Inferenz mit einem sparse MoE von 5 Milliarden aktiven Parametern durchzuführen, das mit größeren dichten Modellen konkurriert, mit einem tatsächlichen Kostenrückgang pro Token, und dass GPT-5.4 jetzt zur Ausnahmebehandlung und nicht zur Standardroute wird. Die dritte, die für Anthropic unangenehmer ist: In dem Bereich, in dem Dario Amodei den Claude positioniert hat, nämlich bei autonomen Agenten, die Schwachstellen reproduzieren, gibt es Konkurrenz von der eigenen Hauptaktionärin im Unternehmensbereich.


Der MAI-Cyber-1-Flash wird nicht für das öffentlich zugängliche Azure OpenAI bereitgestellt. Er läuft im privaten Preview im Azure AI Foundry und ist auf autorisierte Kunden des MDASH beschränkt. Es folgt dem gleichen Muster wie der Security Copilot von 2023: die Kanalisierung des Modells innerhalb des Sicherheitsprodukts, nicht der Verkauf einer rohen API. Für den einkaufenden CISO ist das Angebot operationell. Echte Kostensenkungen bei bereits bestehenden Verträgen. Keine Versprechen über die Verfügbarkeit über andere Azure-Produkte und keine Hinweise im veröffentlichten technischen Material zur Latenz des Routings zwischen Flash und GPT-5.4, eine Metrik, die für automatisierte Bug-Bounty-Pipelines, die in einem Zeitraum von 30 Minuten pro CVE-Kandidat laufen, wichtig wird.


Die Auswirkungen gehen über Redmond hinaus. Amerikanische Banken, die interne Bug-Bounty-Programme durchführen und MDASH als Filterebene nutzen, profitieren von den Kostenvorteilen, ohne den Vertrag anzufassen. Sicherheitsberatungen in Deutschland und dem Vereinigten Königreich, die den Defender for Cloud unter White-Label weiterverkaufen, verschaffen sich einen Wettbewerbsvorteil gegenüber Boutique-Anbietern, die weiterhin vollständig für Tokens von GPT-5.4 bezahlen. In Brasilien kalibrieren große SOC-Teams von Privatbanken, die AppSec mit LLM in der POC-Phase testen, ihr Budget im Hinblick auf die Preise von Claude Opus und GPT-5.4. Die Tabelle hat sich jetzt geändert, und der Käufer wird wahrscheinlich den MSSP-Anbieter auffordern, einen Cross-Check gegen den MDASH durchzuführen, bevor er den nächsten Zyklus unterzeichnet.


Wo die Mathematik noch nicht aufgeht


Microsoft vermeidet direkte Vergleiche zwischen dem MAI-Cyber-1-Flash alleine und dem Mythos. Die 95,95 % im CyberGym gelten für den gesamten MDASH, nicht für das Modell isoliert, und das Routing zu GPT-5.4 bei den 10 % schwierigsten Aufgaben ist genau das, was den Score-Bereich unterstützt. Ohne diese 10 % fällt die Zahl. Die Kommunikation von "Microsofts ersten Modell zur Cybersicherheit" macht im Marketing-Sinne Sinn, aber das technische Ergebnis ist systemisch, nicht modellbasiert. Es ist die Unterscheidung, die eine fundamentale Fähigkeit von einer gut abgestimmten Komposition unterscheidet, und sie wird zurückkommen, wenn ein anderer Anbieter versucht, den Benchmark isoliert zu reproduzieren.

Hauptanalyse