Em 13 de agosto, tivemos uma grande interrupção de serviço que afetou vários serviços da Spaceship.
A causa foi uma falha no sistema de resfriamento do data center RadiusDC: Phoenix, que hospeda algumas operações essenciais da Spaceship. Isso nos forçou a tirar serviços do ar para proteger a infraestrutura dos clientes contra superaquecimento e possíveis danos.
Tudo o que foi afetado pelo incidente já foi restaurado, e nossas equipes continuam monitorando os sistemas de perto para garantir que permaneçam estáveis.
Lamentamos profundamente o impacto sobre os clientes que dependem de nós para seus sites, e-mail e outros serviços online. A interrupção que isso causou, e as circunstâncias por trás dela, estão sendo tratadas com extrema seriedade.
O que aconteceu
O incidente começou quando os sistemas de resfriamento falharam no data center de Phoenix devido a uma grande tempestade, fazendo com que as temperaturas ao redor da nossa infraestrutura atingissem níveis críticos.
Continuar operando os sistemas nessas condições colocava os equipamentos em risco de superaquecimento e de sofrer danos catastróficos e de longo prazo. Tirar os serviços do ar causou uma interrupção significativa, mas foi necessário para proteger a infraestrutura dos nossos clientes.
Manter os equipamentos fora do ar até que os sistemas de resfriamento voltassem a funcionar também deu tempo para que as temperaturas retornassem a níveis seguros antes do início da recuperação. Isso ajudou a evitar a criação de problemas adicionais que poderiam ter prolongado ainda mais um incidente já grave.
Como os clientes foram afetados
A interrupção afetou serviços como Shared, VPS, encaminhamento de e-mail e Spacemail. O Spaceship.com permaneceu online durante todo o incidente.
Aqui está um detalhamento de como a situação afetou os principais produtos e serviços:
Operações de hospedagem
O acesso dos clientes a sites e serviços de hospedagem foi afetado, com muitos sites de clientes indisponíveis, lentos ou retornando erros. Algumas operações de cobrança também ficaram indisponíveis depois que o sistema responsável por processá-las foi tirado do ar durante o incidente.
EasyWP
O Dashboard do EasyWP e os sites dos clientes foram afetados. Durante a recuperação, alguns sites de clientes permaneceram indisponíveis após o EasyWP.com e o Dashboard terem sido restaurados, com alguns retornando erros de conexão com o banco de dados.
Spacemail
Os serviços de e-mail também foram afetados. Os clientes afetados não conseguiam enviar e-mails, e os e-mails recebidos não puderam ser entregues enquanto os servidores relevantes estavam fora do ar.
É importante destacar que isso não significava que as mensagens recebidas eram automaticamente perdidas. Os provedores de e-mail normalmente fazem novas tentativas de entrega quando um servidor de recebimento fica temporariamente indisponível. Portanto, as mensagens chegariam, mas mais tarde do que o normal.
Como restauramos os serviços
A RadiusDC começou a restaurar sua capacidade de resfriamento o mais rápido possível, enquanto resfriadores temporários eram instalados e direcionados para a nossa área do data center para ajudar a reduzir as temperaturas.
Nossas equipes trabalharam continuamente no local ao lado da RadiusDC para restaurar o resfriamento. Só começamos a colocar os serviços de volta no ar quando as temperaturas retornaram a níveis operacionais seguros e tivemos confiança de que não havia risco de superaquecimento ou danos de longo prazo.
Com as condições operacionais seguras restabelecidas, iniciamos uma recuperação controlada em toda a nossa infraestrutura. Isso precisou acontecer de forma progressiva, então os clientes viram diferentes serviços voltarem em momentos diferentes.
Por que os serviços foram restaurados em etapas
A escala do incidente fez com que diferentes partes da nossa plataforma fossem afetadas ao mesmo tempo. Embora os clientes vivenciem isso como serviços separados, o incidente no data center afetou a infraestrutura envolvida na entrega de vários deles.
Serviços como hospedagem e e-mail dependem de várias camadas de tecnologia, incluindo servidores, redes, armazenamento e bancos de dados. Restaurá-los significou colocar esses diferentes elementos de volta no ar na ordem correta, em vez de simplesmente religar tudo de uma vez.
O que acontece agora
Levamos essa interrupção e seu impacto sobre nossos clientes muito a sério.
Nossas equipes estão realizando uma análise completa da situação para fortalecer nossos sistemas e garantir que incidentes semelhantes não voltem a acontecer.
Seremos totalmente transparentes sobre o que aprendermos e compartilharemos os resultados com você, juntamente com as ações que estamos tomando.
CORREÇÃO: Nossa operadora de data center é a RadiusDC, não a PhoenixNAP, como mencionado em várias publicações iniciais no X em 13 de agosto. A PhoenixNAP não está envolvida neste incidente.
Compartilhe seus pensamentos