Ask HN: ¿Por qué OpenAI, Claude y Grok estuvieron caídos simultáneamente?

Varios servicios importantes de IA —incluidos ChatGPT/Codex de OpenAI, Claude de Anthropic y Grok de xAI— sufrieron interrupciones superpuestas, devolviendo 404 y errores de conexión en todo el mundo. Los comentaristas barajan causas que van desde problemas con Cloudflare o con proveedores cloud hasta sobrecarga en cascada, ya que usuarios y herramientas hacen failover automáticamente de un proveedor a otro; informes posteriores apuntan a una interrupción en un centro de cómputo compartido de xAI. El incidente se ve como un recordatorio de lo centralizada e interdependiente que se ha vuelto la infraestructura de IA actual, y como un argumento a favor de tener alternativas locales o de varios proveedores.

Síntomas y alcance de la interrupción

  • Los usuarios informan que ChatGPT / Codex devolvía 404 en chatgpt.com/backend-api/codex/responses, a menudo con IDs cf-ray de Cloudflare que terminan en códigos de aeropuertos.
  • Muchos señalan que es global: hay reportes desde Brasil, India, Europa, EE. UU., etc.
  • Se observó una inestabilidad similar en Claude y Grok (nuevas sesiones fallidas, mensajes de “at capacity”, desconexiones), mientras que algunas sesiones existentes siguieron funcionando.
  • Algunos ven problemas con Gemini y varios proveedores cloud a través de Downdetector, aunque otros dicen que esos servicios les funcionaban bien.
  • Los servicios se recuperan gradualmente; algunos usuarios señalan que Codex/ChatGPT y Claude vuelven región por región.

Causas hipotéticas (todas no confirmadas en el hilo)

  • Problemas de infraestructura compartida:
    • Cloudflare (por cf-ray y picos simultáneos), DNS/BGP, o una dependencia de terceros “crítica”.
    • Principales proveedores cloud: AWS, Azure, Google Cloud, o proveedores de backbone/fibra.
  • Sobrecarga en cascada:
    • Cuando falla un LLM, los usuarios y las herramientas hacen failover automático a otros, lo que potencialmente puede DDoSear a las alternativas.
  • Específico del proveedor:
    • Coincidencia con el lanzamiento de Astra de OpenAI.
    • SpaceX/xAI: una publicación posterior cita un comunicado de xAI sobre una interrupción en un centro de cómputo de Memphis que afectó a Grok y a “compute partners”, pero no está claro cuán directamente se relaciona con todas las interrupciones.
  • Algunos usuarios sospechan de un incidente de Cloudflare HTTP/3 / R2; otros señalan que la dirección de Cloudflare negó cualquier interrupción del servicio.
  • Más sugerencias especulativas (actores estatales, IA rebelde, bugs de cadena de suministro como “left-pad”) se tratan como bromas o especulación.

Páginas de estado y telemetría

  • Las páginas de estado de OpenAI, Anthropic y xAI eventualmente reconocen tasas de error elevadas e interrupciones parciales.
  • Los usuarios comparten enlaces a incidentes y señalan que las páginas de estado oficiales van con retraso y a menudo infrarreportan los problemas.
  • Downdetector muestra picos para múltiples proveedores de IA y cloud, pero los comentaristas insisten en que se basa en reportes de usuarios y puede ser engañoso.

Reacciones de los usuarios y conclusiones

  • Muchos expresan dependencia de los LLM para programar y trabajar; algunos enmarcan la interrupción como un “experimento natural” sobre la pérdida de productividad.
  • Otros destacan los modelos locales/autohospedados (Qwen, Ollama, GPUs en casa) como una cobertura frente a fallos centralizados.
  • El consenso general: la causa raíz exacta no está clara; probablemente sea una mezcla de problemas de infraestructura y de carga en cascada entre proveedores.