Strategie5 Min.Redaktion

GitHub ist sieben Stunden lang offline und bringt Copilot zum Stillstand: Die Monokultur der Entwickler hat ihren teuersten Nachmittag

Sala de guerra de engenharia com três monitores exibindo dashboards em vermelho e anotações manuscritas de incidente sob luz baixa

Der Ausfall begann um 13:40 UTC am Montag, traf Actions, Pull Requests, API und Copilot und endete erst um 21:15 Uhr. Die technische Ursache wurde nicht veröffentlicht.

GitHub erklärte, dass sein Vorfall vom 17. August um 21:15 UTC behoben sei, sieben Stunden und 30 Minuten nachdem die ersten Fehler um 13:40 UTC begonnen hatten. Es war der längste Ausfall der Plattform in den letzten Monaten und der einzige, bei dem Copilot als schwerwiegender Ausfall länger markiert wurde als der Rest des Services, laut dem offiziellen Dashboard des Unternehmens.


Im Laufe des Nachmittags schwankte die Fehlerquote im Webverkehr und in der API um 20%, und die Downloads von Tarballs und Rohinhalten aus Repositories verzeichneten eine Ausfallrate von bis zu 50%. Actions, Pull Requests, Issues, Webhooks und Copilot selbst litten unter einer kaskadierenden Degradation. Gegen 12:47 ET gab GitHub an, den verantwortlichen Baustein identifiziert und Korrekturen angewendet zu haben; jedoch wurde das detaillierte Nachbearbeitungsprotokoll noch nicht veröffentlicht.


Die tatsächlichen Kosten von sieben Stunden ohne CI


Ein CIO, der den Pipeline in GitHub Actions betreibt, hat praktisch einen halben Tag für Deployments verloren. Für Teams, die kontinuierlich Dutzende Male pro Tag deployen, bedeutet dies, Releases neu zu planen, Sicherheitspatches zu verschieben und im Extremfall Wartungsfenster zu verzögern, die bereits mit dem Kunden vereinbart waren. Die Degradation von Pull Requests friert auch die Code-Überprüfung ein, was die Kosten des Vorfalls in die Produktivität der Ingenieure verschiebt, nicht nur auf die des SRE.


Copilot wurde selbst dann als schwerwiegender Ausfall markiert, als der Rest wieder online war. Für Unternehmen, die bereits begonnen haben, die Produktivität ihres Teams gegen Metriken der Akzeptanz von KI-generierten Vorschlägen zu bilanzieren, wird ein Zeitraum, in dem der Assistent einfach nicht antwortet, zu Rauschen in den OKR-Dashboards. JetBrains schätzte im Januar 2026, dass 18% der Entwickler Copilot als primäres Werkzeug zum Vervollständigen von Code verwenden; sieben Stunden ohne ihn sind sieben Stunden, in denen diese Gruppe manuell geschrieben hat, was sie mit Vorschlag geschrieben hätte.


Der einzige Ausfallpunkt kehrt zur Debatte zurück


Das Muster des letzten Jahrzehnts hat GitHub als einzige Schicht für Code, Überprüfung, CI und jetzt KI-Agenten konsolidiert. Der Ausfall am Montag belebt eine Diskussion, die die DevOps-Community hinausgezögert hat: Wie viel operationelles Risiko kann in einem einzigen Anbieter konzentriert werden? Für operationale Abläufe, die den DORA-Vorgaben in Europa entsprechen, wird die Antwort zunehmend vertraglich geregelt, wobei Banken Klauseln für Ausstiege und Pläne zur Portabilität von Repositories selbst für nicht-kritischen Code verlangen.


Die Auswirkungen beschränkten sich nicht nur auf die amerikanische Westküste. Ingenieurteams in Indien, wo die großen Lieferzentren von TCS, Infosys und Wipro über 400.000 Entwickler auf GitHub Enterprise betreiben, spürten den Ausfall gegen Ende des lokalen Arbeitstags. TCS berichtete im letzten Quartalsbericht, dass 92% seiner Anwendungsprojekte bereits Pipelines auf Actions oder GitHub Enterprise Server betreiben. In Deutschland und im Vereinigten Königreich traf der Vorfall den Nachmittagshochpunkt und erforderte Notfallpläne, die viele SREs seit dem letzten großen Ausfall von AWS us-east-1 im Oktober 2021 nicht mehr getestet hatten. Deutsche Bank, ING und HSBC betreiben GitHub Enterprise Cloud und haben interne Regeln, die vorschreiben, dass ein Failover-Test zu GitLab alle sechs Monate durchgeführt werden muss. In Brasilien, wo ein relevanter Teil der Softwarefabriken für amerikanische Kunden Actions als Hauptorchestrator nutzt, war der Vormittag von Rückständen geprägt, wobei CI&T, TIVIT und Stefanini die Releases für Finanzkunden neu planen mussten, die auf Deployments am Ende des ET-Arbeitstags angewiesen waren.


Microsoft hat nicht bekannt gegeben, ob das Problem mit einem internen Deployment, einer Abhängigkeit von einem anderen Azure-Dienst oder mit Kapazitätserschöpfung zusammenhing. Das Fehlen dieser Informationen, mehr noch als die Dauer des Ausfalls selbst, bereitet Unternehmenskunden Sorgen: Ohne klare Ursachenanalyse bleibt das Vorgehen für das nächste Mal einfach abzuwarten.


Eine Antwort, die zum Vertrag wird


Der nächste Vertragsverlängerungszyklus für GitHub Enterprise in Europa wird mit einem neuen Punkt auf der Agenda eintreffen: vertragliche Garantien für Credits wegen Ausfallzeiten, die den tatsächlichen Schaden widerspiegeln und nicht den Preis des Abonnements. Banken und Versicherungen haben seit dem ersten Quartal begonnen, Klauseln für die Portabilität zu GitLab aufzunehmen und zu verlangen, dass der Anbieter jährliche Tests für regionales Failover nachweist. Wenn Microsoft in den nächsten 48 Stunden ein transparentes Nachbearbeitungsprotokoll veröffentlicht, verstummt die Diskussion. Verzögert es sich, wird die nächste Verlängerung zur Verhandlungsfrage über Strafen.

Die Analyse der Woche, per E-Mail

Eine wöchentliche Ausgabe mit dem, was für Entscheider zählt. Keine Werbung, kein Sponsoring.

Jederzeit mit einem Klick kündbar.

Strategie