El 13 de agosto, sufrimos una importante interrupción del servicio que afectó a varios servicios de Spaceship.
La causa fue un fallo del sistema de refrigeración en el centro de datos RadiusDC: Phoenix, que aloja algunas operaciones esenciales de Spaceship. Esto nos obligó a desconectar servicios para proteger la infraestructura de los clientes del sobrecalentamiento y de posibles daños.
Todo lo afectado por el incidente ya se ha restaurado, y nuestros equipos siguen supervisando los sistemas de cerca para garantizar que permanezcan estables.
Lamentamos profundamente el impacto en los clientes que dependen de nosotros para sus sitios web, correo electrónico y otros servicios en línea. La interrupción que esto causó, y las circunstancias que la provocaron, se están tomando con la máxima seriedad.
Qué ocurrió
El incidente comenzó cuando los sistemas de refrigeración fallaron en el centro de datos de Phoenix debido a una gran tormenta, lo que provocó que las temperaturas alrededor de nuestra infraestructura alcanzaran niveles críticos.
Seguir operando los sistemas en esas condiciones suponía el riesgo de que los equipos se sobrecalentaran y sufrieran daños catastróficos y a largo plazo. Desconectar los servicios causó una interrupción significativa, pero era necesario para proteger la infraestructura de nuestros clientes.
Mantener los equipos desconectados hasta que los sistemas de refrigeración volvieran a estar en línea también dio tiempo a que las temperaturas regresaran a niveles seguros antes de que comenzara la recuperación. Esto ayudó a evitar crear más problemas que podrían haber prolongado aún más un incidente que ya era grave.
Cómo se vieron afectados los clientes
La interrupción afectó a servicios como Shared, VPS, el reenvío de correo electrónico y Spacemail. Spaceship.com permaneció en línea durante todo el incidente.
Aquí tienes un desglose de cómo afectó la situación a los productos y servicios clave:
Operaciones de hosting
El acceso de los clientes a los sitios web y a los servicios de hosting se vio afectado, y muchos sitios web de clientes no estaban disponibles, funcionaban con lentitud o devolvían errores. Algunas operaciones de facturación tampoco estuvieron disponibles después de que el sistema responsable de procesarlas se desconectara durante el incidente.
EasyWP
El panel de control de EasyWP y los sitios web de los clientes se vieron afectados. Durante la recuperación, algunos sitios web de clientes siguieron sin estar disponibles después de que EasyWP.com y el panel de control se restauraran, y algunos devolvían errores de conexión con la base de datos.
Spacemail
Los servicios de correo electrónico también se vieron afectados. Los clientes afectados no podían enviar correos electrónicos, y los correos entrantes no podían entregarse mientras los servidores correspondientes estaban desconectados.
Es importante destacar que esto no significaba que los mensajes entrantes se perdieran automáticamente. Los proveedores de correo normalmente realizan más intentos de entrega cuando un servidor receptor no está disponible temporalmente. Por lo tanto, los mensajes llegarían, pero más tarde de lo habitual.
Cómo restauramos los servicios
RadiusDC comenzó a restaurar su capacidad de refrigeración lo antes posible, mientras se instalaban enfriadores temporales y se dirigían a nuestra zona del centro de datos para ayudar a reducir las temperaturas.
Nuestros equipos trabajaron de forma continua in situ junto con RadiusDC para restaurar la refrigeración. Solo empezamos a volver a poner los servicios en línea una vez que las temperaturas regresaron a niveles operativos seguros y tuvimos la certeza de que no existía riesgo de sobrecalentamiento ni de daños a largo plazo.
Una vez restablecidas las condiciones operativas seguras, iniciamos una recuperación controlada en toda nuestra infraestructura. Esto tuvo que hacerse de forma progresiva, por lo que los clientes vieron cómo los distintos servicios volvían en momentos diferentes.
Por qué los servicios se restauraron por fases
La magnitud del incidente hizo que distintas partes de nuestra plataforma se vieran afectadas al mismo tiempo. Aunque los clientes los perciben como servicios independientes, el incidente en el centro de datos afectó a la infraestructura implicada en la prestación de varios de ellos.
Servicios como el hosting y el correo electrónico dependen de múltiples capas de tecnología, incluidos servidores, redes, almacenamiento y bases de datos. Restaurarlos implicó volver a poner en línea estos distintos elementos en el orden correcto, en lugar de simplemente volver a encenderlo todo de una vez.
Qué ocurre a continuación
Nos tomamos muy en serio esta interrupción y su impacto en nuestros clientes.
Nuestros equipos están llevando a cabo una revisión exhaustiva de la situación para reforzar nuestros sistemas y garantizar que incidentes similares no vuelvan a ocurrir.
Seremos completamente transparentes sobre lo que aprendamos y compartiremos contigo los resultados, junto con las medidas que estamos tomando.
CORRECCIÓN: Nuestro operador del centro de datos es RadiusDC, no PhoenixNAP, como se mencionó en varias publicaciones iniciales en X el 13 de agosto. PhoenixNAP no está involucrado en este incidente.
Comparte tus ideas