Ask HN: ¿Por qué OpenAI, Claude y Grok estuvieron caídos simultáneamente?
Varios servicios importantes de IA —incluidos ChatGPT/Codex de OpenAI, Claude de Anthropic y Grok de xAI— sufrieron interrupciones superpuestas, devolviendo 404 y errores de conexión en todo el mundo. Los comentaristas barajan causas que van desde problemas con Cloudflare o con proveedores cloud hasta sobrecarga en cascada, ya que usuarios y herramientas hacen failover automáticamente de un proveedor a otro; informes posteriores apuntan a una interrupción en un centro de cómputo compartido de xAI. El incidente se ve como un recordatorio de lo centralizada e interdependiente que se ha vuelto la infraestructura de IA actual, y como un argumento a favor de tener alternativas locales o de varios proveedores.
Síntomas y alcance de la interrupción
- Los usuarios informan que ChatGPT / Codex devolvía 404 en
chatgpt.com/backend-api/codex/responses, a menudo con IDscf-rayde Cloudflare que terminan en códigos de aeropuertos. - Muchos señalan que es global: hay reportes desde Brasil, India, Europa, EE. UU., etc.
- Se observó una inestabilidad similar en Claude y Grok (nuevas sesiones fallidas, mensajes de “at capacity”, desconexiones), mientras que algunas sesiones existentes siguieron funcionando.
- Algunos ven problemas con Gemini y varios proveedores cloud a través de Downdetector, aunque otros dicen que esos servicios les funcionaban bien.
- Los servicios se recuperan gradualmente; algunos usuarios señalan que Codex/ChatGPT y Claude vuelven región por región.
Causas hipotéticas (todas no confirmadas en el hilo)
- Problemas de infraestructura compartida:
- Cloudflare (por
cf-rayy picos simultáneos), DNS/BGP, o una dependencia de terceros “crítica”. - Principales proveedores cloud: AWS, Azure, Google Cloud, o proveedores de backbone/fibra.
- Cloudflare (por
- Sobrecarga en cascada:
- Cuando falla un LLM, los usuarios y las herramientas hacen failover automático a otros, lo que potencialmente puede DDoSear a las alternativas.
- Específico del proveedor:
- Coincidencia con el lanzamiento de Astra de OpenAI.
- SpaceX/xAI: una publicación posterior cita un comunicado de xAI sobre una interrupción en un centro de cómputo de Memphis que afectó a Grok y a “compute partners”, pero no está claro cuán directamente se relaciona con todas las interrupciones.
- Algunos usuarios sospechan de un incidente de Cloudflare HTTP/3 / R2; otros señalan que la dirección de Cloudflare negó cualquier interrupción del servicio.
- Más sugerencias especulativas (actores estatales, IA rebelde, bugs de cadena de suministro como “left-pad”) se tratan como bromas o especulación.
Páginas de estado y telemetría
- Las páginas de estado de OpenAI, Anthropic y xAI eventualmente reconocen tasas de error elevadas e interrupciones parciales.
- Los usuarios comparten enlaces a incidentes y señalan que las páginas de estado oficiales van con retraso y a menudo infrarreportan los problemas.
- Downdetector muestra picos para múltiples proveedores de IA y cloud, pero los comentaristas insisten en que se basa en reportes de usuarios y puede ser engañoso.
Reacciones de los usuarios y conclusiones
- Muchos expresan dependencia de los LLM para programar y trabajar; algunos enmarcan la interrupción como un “experimento natural” sobre la pérdida de productividad.
- Otros destacan los modelos locales/autohospedados (Qwen, Ollama, GPUs en casa) como una cobertura frente a fallos centralizados.
- El consenso general: la causa raíz exacta no está clara; probablemente sea una mezcla de problemas de infraestructura y de carga en cascada entre proveedores.