Sicherheit & Risiko6 Min.Redaktion

Ausfall in Azure East US nimmt ChatGPT, Claude und Grok gleichzeitig für 90 Minuten offline

Técnico em telhado de prédio em Manhattan ao amanhecer, próximo a equipamento de refrigeração com LED vermelho aceso.

Drei der vier größten Chatbots der Welt fielen am Donnerstagmorgen innerhalb desselben Zeitfensters aus, da sie sich in derselben Region von Microsoft befinden. Das Gemini von Google Cloud blieb aktiv.

Ein Ausfall in der Microsoft-Region Azure East US hat ChatGPT, Claude und Grok am Donnerstagmorgen, dem 3. September, fast gleichzeitig für etwa 90 Minuten offline genommen. Downdetector verzeichnete zu Spitzenzeiten über 37.000 Beschwerden über OpenAI, etwa 1.365 über Grok und 1.300 über Claude. Das Gemini von Google, das in Google Cloud gehostet wird, verzeichnete lediglich rund 500 Beschwerden und lief weiterhin normal.


Dieser Vorfall ist kein kurzfristiger Schreck. Er ist der empirische Beweis für ein Risiko, das Infrastruktur-Manager bisher als hypothetisch behandelt hatten. OpenAI betreibt seit der milliardenschweren Investition von Microsoft in Azure und verarbeitet einen wesentlichen Teil des Verkehrsdatenverkehrs dort. Anthropic verfolgt eine Multicloud-Strategie zwischen AWS, Google Cloud und Azure, aber ein relevanter Teil des Produktionsverkehrs von Claude geht immer noch über Azure-Routen. xAI, obwohl Colossus in Memphis mit eigener Hardware betreibt, leitet Ausgeh-Routen über dasselbe Backbone. Drei konkurrierende Labore, ein einzelner regionale Ausfall.


Was die Nachbetrachtung wahrscheinlich zeigen wird


Microsoft hat noch keine abschließende Analyse veröffentlicht. Der Trend der letzten Serie von Vorfällen, einschließlich des globalen Ausfalls im Juli, der Xbox und Microsoft 365 betraf, deutet auf Engpässe in zentralisierten Identitäts- oder Netzwerkdiensten hin und nicht auf einen spezifischen Chip oder ein physisches Rechenzentrum. Dies ist die Art von Ausfällen, die einen regionalen Kaskadeneffekt erzeugt: Die Region East US konzentriert ein überproportionales Volumen an Inferenz-Workloads, da sie die Verfügbarkeit von GPUs H100 und H200, latenzfreundliche Bedingungen für die Ostküste und direkte Integration mit dem Azure OpenAI-Service kombiniert.


Der Copilot, der Assistent von Microsoft, zeigte innerhalb desselben Zeitfensters Instabilitäten, obwohl er auf interner Azure-Infrastruktur läuft. Dies unterstreicht die Interpretation, dass der Ausfall eine geteilte Schicht betroffen hat, nicht isolierte Rechenkapazität.


Die Rechnung, die am Montag beim CIO ankommt


Für Unternehmenskunden, die kritische Pipelines über einen einzigen LLM-Anbieter betreiben, zwingt der Vorfall vom 3. September zur Entscheidung, die viele bereits aufgeschoben haben. Anthropic versucht, Kapital zu schlagen, indem es automatisches Failover zwischen AWS Bedrock und Google Vertex anbietet; OpenAI hat noch nicht die gleiche Flexibilität für das neu eingeführte Modell Astra eröffnet. In der Praxis wurde ein Unternehmensworkflow, der auf ChatGPT über API für Kundenservice, Vertragsanalysen oder Code-Generierung angewiesen ist, für anderthalb Stunden mit keiner nützlichen Antwort konfrontiert, ohne SLA für automatische Gutschriften, die die Geschäftsstörung kompensieren könnten.


Gartner prognostizierte im Juli, dass 40% der Unternehmen mit einem Umsatz von über 1 Milliarde USD bereits KI-Agenten in der Produktion einsetzen. Ein 90-minütiger Ausfall in dieser Ebene hat Kaskadeneffekte auf CRM-Tools, die an Agentforce weiterleiten, auf Code-Review-Pipelines, die auf Copilot oder Claude Code angewiesen sind, und auf Services mit Drittanbieter-Voicebots. Die direkten Kosten sind schwer zu schätzen, ohne öffentliche Zahlen, aber Analysten von Constellation Research sprechen von einem Verlust an aggregierten Einnahmen zwischen 40 Millionen USD und 80 Millionen USD an einem einzigen Tag bei den drei größten Unternehmenskunden von OpenAI.


Deutschland und Brasilien in derselben Falle


Die Deutsche Bank, die im Mai die Standardisierung von Code-Assistenten auf Claude für 30.000 Entwickler bekanntgab, und die Deutsche Telekom, die Kundenservice-Automatisierung mit ChatGPT Enterprise einsetzt, erlebten denselben Zeitraum der Unverfügbarkeit in ihren europäischen Operationen, da East US die primäre Failover-Region für Spitzenlasten aus der EU ist. In Brasilien erlebten Itaú und Bradesco, die einen Teil des BIA und des Personnalité Assistant über Azure-Endpunkte abwickeln, denselben gleichzeitigen Ausfall, obwohl dies aufgrund lokaler Cache-Ebenen für den Endkunden nicht spürbar war.


Was der 3. September klar macht, ist, dass die Multicloud-Strategie der Modellanbieter den Unternehmenskunden nicht schützt, wenn dieser Kunde sich für einen einzigen Modellanbieter entscheidet. Die Resilienzschicht muss ein Level höher angehoben werden: von der Infrastruktur auf das Routing von Modellen. Unternehmen wie Portkey, Kong AI Gateway und OpenRouter, die als Routing-Waren fungierten, haben sofortige kommerzielle Munition gewonnen, die sie am Dienstag nicht hatten.

Die Analyse der Woche, per E-Mail

Eine wöchentliche Ausgabe mit dem, was für Entscheider zählt. Keine Werbung, kein Sponsoring.

Jederzeit mit einem Klick kündbar.

Sicherheit & Risiko