El 13 de agosto, experimentamos una interrupción importante del servicio que afectó varios servicios de Spaceship.
La causa fue una falla en el sistema de enfriamiento en el centro de datos RadiusDC: Phoenix, que aloja algunas operaciones esenciales de Spaceship. Esto nos obligó a desconectar servicios para proteger la infraestructura de los clientes contra el sobrecalentamiento y posibles daños.
Todo lo afectado por el incidente ya ha sido restaurado, y nuestros equipos continúan monitoreando los sistemas de cerca para asegurar que permanezcan estables.
Lamentamos profundamente el impacto en los clientes que dependen de nosotros para sus sitios web, correo electrónico y otros servicios en línea. La interrupción que esto causó, y las circunstancias detrás de ella, se están tomando con extrema seriedad.
Qué pasó
El incidente comenzó cuando los sistemas de enfriamiento fallaron en el centro de datos de Phoenix debido a una tormenta importante, lo que provocó que las temperaturas alrededor de nuestra infraestructura alcanzaran niveles críticos.
Seguir operando los sistemas en esas condiciones implicaba el riesgo de que el equipo se sobrecalentara y sufriera daños catastróficos y a largo plazo. Desconectar los servicios causó una interrupción significativa, pero fue necesario para proteger la infraestructura de nuestros clientes.
Mantener el equipo fuera de línea hasta que los sistemas de enfriamiento volvieran a estar en línea también dio tiempo para que las temperaturas regresaran a niveles seguros antes de que comenzara la recuperación. Esto ayudó a evitar crear más problemas que pudieran haber prolongado aún más un incidente ya grave.
Cómo se vieron afectados los clientes
La interrupción afectó servicios como Shared, VPS, reenvío de correo electrónico y Spacemail. Spaceship.com permaneció en línea durante todo el incidente.
Aquí hay un resumen de cómo la situación afectó productos y servicios clave:
Operaciones de hosting
El acceso de los clientes a los sitios web y servicios de hosting se vio afectado, y muchos sitios web de clientes no estaban disponibles, estaban lentos o devolvían errores. Algunas operaciones de facturación tampoco estuvieron disponibles después de que el sistema responsable de procesarlas se desconectó durante el incidente.
EasyWP
El panel de control de EasyWP y los sitios web de los clientes se vieron afectados. Durante la recuperación, algunos sitios web de clientes siguieron sin estar disponibles después de que EasyWP.com y el panel de control fueron restaurados, y algunos devolvían errores de conexión a la base de datos.
Spacemail
Los servicios de correo electrónico también se vieron afectados. Los clientes afectados no podían enviar correos electrónicos, y los correos entrantes no podían entregarse mientras los servidores correspondientes estaban fuera de línea.
Es importante destacar que esto no significó que los mensajes entrantes se perdieran automáticamente. Los proveedores de correo normalmente hacen más intentos de entrega cuando un servidor receptor no está disponible temporalmente. Así que los mensajes llegarían, pero más tarde de lo habitual.
Cómo restauramos los servicios
RadiusDC comenzó a restaurar su capacidad de enfriamiento lo antes posible, mientras se instalaron enfriadores temporales y se dirigieron a nuestra área del centro de datos para ayudar a reducir las temperaturas.
Nuestros equipos trabajaron continuamente en el sitio junto con RadiusDC para restaurar el enfriamiento. Solo comenzamos a volver a poner los servicios en línea una vez que las temperaturas regresaron a niveles operativos seguros y tuvimos la certeza de que no había riesgo de sobrecalentamiento ni de daños a largo plazo.
Con las condiciones operativas seguras restablecidas, comenzamos una recuperación controlada en toda nuestra infraestructura. Esto tuvo que suceder de manera progresiva, por lo que los clientes vieron regresar distintos servicios en diferentes momentos.
Por qué los servicios se restauraron por etapas
La magnitud del incidente significó que diferentes partes de nuestra plataforma se vieran afectadas al mismo tiempo. Aunque los clientes experimentan estos como servicios separados, el incidente en el centro de datos afectó la infraestructura involucrada en la prestación de varios de ellos.
Servicios como hosting y correo electrónico dependen de múltiples capas de tecnología, incluidos servidores, redes, almacenamiento y bases de datos. Restaurarlos significó volver a poner en línea estos diferentes elementos en el orden correcto, en lugar de simplemente volver a encender todo al mismo tiempo.
Qué sigue
Tomamos esta interrupción y su impacto en nuestros clientes muy en serio.
Nuestros equipos están realizando una revisión exhaustiva de la situación para fortalecer nuestros sistemas y asegurar que incidentes similares no vuelvan a ocurrir.
Seremos completamente transparentes sobre lo que aprendamos y compartiremos los resultados con ustedes, junto con las acciones que estamos tomando.
CORRECCIÓN: Nuestro operador de centro de datos es RadiusDC, no PhoenixNAP como se mencionó en varias publicaciones iniciales en X el 13 de agosto. PhoenixNAP no está involucrado en este incidente.
Comparte tus pensamientos