Seguridad y Riesgo6 minRedacción

Fallo en Azure East US derriba ChatGPT, Claude y Grok al mismo tiempo durante 90 minutos

Técnico em telhado de prédio em Manhattan ao amanhecer, próximo a equipamento de refrigeração com LED vermelho aceso.

Tres de los cuatro mayores chatbots del mundo cayeron en la mañana del jueves dentro de la misma ventana porque comparten la misma región de Microsoft. El Gemini, de Google Cloud, se mantuvo operativo.

Una falla en la región Azure East US de Microsoft sacó de funcionamiento a ChatGPT, Claude y Grok casi simultáneamente en la mañana del jueves 3 de septiembre, dentro de una ventana de aproximadamente 90 minutos. Downdetector registró más de 37 mil quejas contra OpenAI, alrededor de 1,365 contra Grok y 1,300 contra Claude en el pico del incidente. El Gemini, de Google, alojado en Google Cloud, vio el número de quejas detenerse en torno a 500 y continuó operando normalmente.


El episodio no es un susto pasajero. Es la evidencia empírica, en un único intervalo de tiempo, de una concentración de riesgo que los ejecutivos de infraestructura venían tratando como hipotética. OpenAI opera en Azure desde que la Microsoft realizó su inversión multibillonaria y maneja una parte sustancial del tráfico de inferencias allí. Anthropic adopta una estrategia multicloud entre AWS, Google Cloud y Azure, pero parte relevante del tráfico de producción de Claude aún pasa por rutas vinculadas a Azure. xAI, a pesar de operar Colossus en Memphis con hardware propio, dirige rutas de salida por la misma infraestructura. Tres laboratorios competidores, una única falla de región.


Lo que el post-mortem probablemente mostrará


Microsoft aún no ha publicado un análisis final. El patrón de la última serie de incidentes, incluido el apagón global de julio que afectó a Xbox y Microsoft 365, apunta a un cuello de botella en servicios centralizados de identidad o red, y no en un chip o centro de datos físico específico. Esta es la categoría de falla que genera efecto cascada regional: la región East US concentra un volumen desproporcionado de cargas de trabajo de inferencias porque combina la disponibilidad de GPUs H100 y H200, latencia favorable para la costa este e integración directa con el Azure OpenAI Service.


El Copilot, asistente de Microsoft, presentó inestabilidad dentro de la misma ventana, a pesar de funcionar en infraestructura Azure interna. Esto refuerza la lectura de que la falla alcanzó una capa compartida, no capacidad de cómputo aislada.


La cuenta que llega al CIO el lunes


Para clientes corporativos que manejan pipelines críticos sobre un único proveedor de LLM, el incidente del 3 de septiembre fuerza la decisión que muchos habían estado posponiendo. Anthropic intenta capitalizar ofreciendo failover automático entre AWS Bedrock y Google Vertex; OpenAI aún no ofrece la misma flexibilidad para el modelo Astra recién lanzado. En la práctica, un flujo de trabajo empresarial que dependa de ChatGPT a través de API para atención, análisis contractual o generación de código quedó sin una respuesta útil durante una hora y media, sin un SLA de crédito automático capaz de compensar la interrupción del negocio.


Gartner proyectó en julio que el 40% de las empresas con ingresos superiores a $1 mil millones ya operan agentes de IA en producción. Una parada de 90 minutos en esta capa genera un efecto cascada en herramientas de CRM que despachan para Agentforce, en pipelines de revisión de código que dependen de Copilot o Claude Code y en atención con bots de voz de terceros. El costo directo es difícil de estimar sin números públicos, pero analistas de Constellation Research hablan de algo entre $40 millones y $80 millones en ingresos agregados perdidos entre los tres mayores clientes empresariales de OpenAI en el día.


Alemania y Brasil en la misma trampa


Deutsche Bank, que anunció en mayo la estandarización de asistentes de código en Claude para 30,000 desarrolladores, y Deutsche Telekom, que maneja automatización de atención en ChatGPT Enterprise, sintieron la misma ventana de indisponibilidad en las operaciones europeas porque East US es la región primaria de failover para picos provenientes de la UE. En Brasil, Itaú y Bradesco, que trafican parte del BIA y del Personnalité Assistant por endpoints Azure, vieron la misma caída simultánea, aunque sin un impacto perceptible al cliente final debido a capas de caché local.


Lo que el 3 de septiembre deja claro es que la estrategia de multicloud de los proveedores de modelos no protege al cliente empresarial cuando este cliente elige un único proveedor de modelo. La capa de resiliencia necesita subir un peldaño: de la infraestructura al enrutamiento de modelos. Empresas como Portkey, Kong AI Gateway y OpenRouter, que hacían el papel de commodities de enrutamiento, ganaron munición comercial inmediata que no tenían el martes.

El análisis de la semana, por correo

Una edición semanal con lo que importa a quien decide. Sin anuncios, sin patrocinio.

Cancelación en un clic, cuando quieras.

Seguridad y Riesgo