Tres proveedores de IA fallan en cadena en 90 minutos, Google sigue normal

La noche del 3 de septiembre, hora de Pekín, los servicios de modelos de Anthropic, xAI y OpenAI entraron en fallo en cadena en el lapso de hora y media. La página de estado de Anthropic publicó el primer aviso a las 21:26 hora de Pekín (13:26 UTC), toda la línea Grok de xAI fue marcada como degradada por plataformas río abajo a las 21:41, y OpenAI empezó a reportar un aumento en la tasa de errores de ChatGPT y Codex hacia las 22:56. Hacia las 23:15, los incidentes de las tres empresas seguían en estado de "investigación" o "en solución", ninguna anunció haberse recuperado.

En ese mismo periodo, Gemini y Vertex AI de Google no registraron ningún incidente, y en el panel agregador de estado de terceros la casilla de Google seguía en verde con "All services operational".

Panel agregador de estado de terceros: OpenAI y Anthropic aparecen degradados, xAI aparece caído, la IA de Google está normal
Panel agregador de estado de terceros: OpenAI y Anthropic aparecen degradados, xAI aparece caído, la IA de Google está normal

Cronología: las tres empresas entran en escena una tras otra

Anthropic fue la primera. A las 21:26, la página de estado decía "investigando un aumento en la tasa de errores de solicitudes de Claude Mythos 5.1, Fable 5.1, Opus 5"; 15 minutos después cambió a "causa identificada, en proceso de solución". A las 21:50 se añadió la lista completa: las dos generaciones 5.1 y 5 de Mythos y Fable, Opus 5, Opus 4.8 y Opus 4.6 estaban todos afectados, Haiku y Sonnet no aparecían en la lista. La actualización de las 22:49 solo traía la frase "seguimos en proceso de solución".

xAI la siguió de cerca. La propia página de estado de xAI devolvió un error 403 al intentar consultarla, por lo que no se pudo revisar directamente. Lo que sí se puede confirmar es que Cursor publicó a las 21:41 un aviso de "investigando degradación del servicio", especificando como afectados "todos los modelos Grok, Automations, Cloud Agents, Grok Bot y Review Agents". En el panel agregador, xAI fue la única de las cuatro empresas marcada en rojo como "Down".

OpenAI fue la última en entrar, pero la más percibida por los usuarios. Hacia las 22:56, la página de estado mostró "Elevated errors across ChatGPT and Codex", con una explicación limitada a "investigando". En ese momento, algunos usuarios que abrieron chatgpt.com recibieron el código HTTP 404, un error que normalmente indica que un nodo de borde no encontró la ruta, de naturaleza distinta a los errores 5xx del lado del modelo.

Página de estado de OpenAI: aumento en la tasa de errores de ChatGPT y Codex, captura tomada cinco minutos después de iniciado el incidente
Página de estado de OpenAI: aumento en la tasa de errores de ChatGPT y Codex, captura tomada cinco minutos después de iniciado el incidente
Algunos usuarios que accedieron a chatgpt.com recibieron el código HTTP 404
Algunos usuarios que accedieron a chatgpt.com recibieron el código HTTP 404

Río abajo se dieron cuenta primero

La página de estado de Cursor mostró esa misma noche dos incidentes simultáneos. Uno era la degradación de Grok a las 21:41, el otro era el "aumento en la tasa de errores de los modelos de Anthropic" a las 22:17, este último atribuido explícitamente a un "problema upstream de Anthropic" que causaba errores en solicitudes a Fable 5.1, Fable 5, Opus 5, Opus 4.8 y Opus 4.6, "algunos usuarios experimentarán errores o fallos en turnos de Agent".

Página de estado de Cursor con dos incidentes simultáneos: degradación de toda la línea Grok y error upstream de Anthropic
Página de estado de Cursor con dos incidentes simultáneos: degradación de toda la línea Grok y error upstream de Anthropic

Esta lista coincide con la que la propia Anthropic dio, solo falta Mythos, modelo que Cursor de todos modos no integra. Para las herramientas de programación con IA, que dos proveedores upstream fallaran la misma noche redujo a la mitad, de golpe, la capacidad de respaldo que promete el argumento de venta de "redundancia multimodelo".

Los desarrolladores en China quedaron aún más en desventaja. La mayoría usa API de reenvío o plataformas agregadoras, así que la información del fallo pasa por una capa adicional de intermediación antes de llegarles; los proveedores de reenvío suelen mostrar solo "anomalía upstream", sin distinguir qué empresa ni qué modelo. Esa noche, Haiku y Sonnet de Claude no estaban en la lista de modelos afectados, y Gemini estuvo disponible todo el tiempo: quien lo sabía podía cambiar de modelo directamente, quien no lo sabía solo podía actualizar la página y esperar.

Google salió ileso: ¿pista o coincidencia?

La primera hipótesis que surgió en la comunidad tecnológica china fue "problema en algún enlace upstream o en el DNS". Esta hipótesis no se puede verificar por ahora. Hay dos pruebas en contra: la lista de incidentes de Google Cloud no tuvo ninguna adición ese día, Gemini funcionó con normalidad todo el día; y la formulación de Anthropic fue "causa identificada", lo que apunta hacia algo interno de la propia empresa, mientras que un fallo de infraestructura compartida suele describirse como "proveedor upstream".

También hay pruebas a favor. Lo afectado en Anthropic fueron todo modelos grandes, los modelos pequeños se salvaron; en xAI se marcó "todos los modelos Grok"; OpenAI solo listó ChatGPT y Codex, con la columna de la API en verde. El alcance del daño en las tres empresas se concentró en los modelos grandes del lado de inferencia, lo que se parece más a un problema regional de algún proveedor de capacidad de cómputo que a un fallo de DNS, donde "nada sería accesible".

Un monitor de disponibilidad de terceros aporta otro punto de comparación. A las 23:37 hora de Pekín (15:37 UTC) marcaba nueve servicios: además de Cursor, Claude y OpenAI, señalaba degradación parcial en Cloudflare, Supabase, GitHub, Notion, SendGrid y Twilio. La lista parece respaldar la hipótesis de un upstream compartido, pero la página de estado oficial de Cloudflare no añadió ningún incidente nuevo esa noche; los dos elementos abiertos eran problemas de R2 y WARP arrastrados desde finales de agosto, y no hay pruebas que vinculen las demás degradaciones con el suceso de esta noche. La misma página mostraba a Grok de nuevo operativo a las 23:37.

Monitor de disponibilidad de terceros a las 23:37 hora de Pekín: nueve servicios con fallos, Cursor marcado como fallo grave
Captura de la página de estado de ip.net.coffee, 23:37 hora de Pekín

De estas pistas solo se puede concluir que "la inferencia de los modelos grandes de las tres empresas tuvo problemas en el mismo periodo"; ir más allá ya sería especulación. Ninguna de las tres ha publicado un informe del incidente, y las actualizaciones públicas tampoco mencionan a terceros. Qué explicación resulta cierta tendrá que esperar al análisis posterior de cada empresa, que suele tardar de tres a cinco días hábiles.

Fuentes: página de estado de Anthropic, página de estado de OpenAI, página de estado de Cursor, lista de incidentes de Google Cloud, CocoLoop y capturas de pantalla de usuarios de la comunidad; la lista de modelos afectados y las etapas del incidente de cada empresa se cotejaron con el texto original de sus páginas de estado, la página de estado de xAI devolvió un error 403 al intentar consultarla, por lo que su alcance se determinó a partir de la página de estado de Cursor y del panel agregador de terceros.