A 13 de agosto, sofremos uma grande interrupção de serviço que afetou vários serviços da Spaceship.
A causa foi uma falha no sistema de arrefecimento do centro de dados RadiusDC: Phoenix, que aloja algumas operações essenciais da Spaceship. Isto obrigou-nos a colocar serviços offline para proteger a infraestrutura dos clientes contra sobreaquecimento e possíveis danos.
Tudo o que foi afetado pelo incidente já foi restaurado, e as nossas equipas continuam a monitorizar os sistemas de perto para garantir que se mantêm estáveis.
Lamentamos profundamente o impacto nos clientes que dependem de nós para os seus websites, email e outros serviços online. A interrupção que isto causou, e as circunstâncias por detrás dela, estão a ser levadas extremamente a sério.
O que aconteceu
O incidente começou quando os sistemas de arrefecimento falharam no centro de dados de Phoenix devido a uma grande tempestade, fazendo com que as temperaturas em torno da nossa infraestrutura atingissem níveis críticos.
Continuar a operar os sistemas nestas condições arriscava que o equipamento sobreaquecesse e sofresse danos catastróficos e a mais longo prazo. Colocar os serviços offline causou uma perturbação significativa, mas foi necessário para proteger a infraestrutura dos nossos clientes.
Manter o equipamento offline até os sistemas de arrefecimento voltarem a estar online também deu tempo para as temperaturas regressarem a níveis seguros antes do início da recuperação. Isto ajudou a evitar criar mais problemas que poderiam ter prolongado ainda mais um incidente já de si grave.
Como os clientes foram afetados
A interrupção afetou serviços como Shared, VPS, reencaminhamento de email e Spacemail. O Spaceship.com manteve-se online durante todo o incidente.
Aqui tens um resumo de como a situação afetou os principais produtos e serviços:
Operações de alojamento
O acesso dos clientes a websites e serviços de alojamento foi afetado, com muitos websites de clientes indisponíveis, lentos ou a devolver erros. Algumas operações de faturação também ficaram indisponíveis depois de o sistema responsável pelo seu processamento ter sido colocado offline durante o incidente.
EasyWP
O Dashboard do EasyWP e os websites dos clientes foram afetados. Durante a recuperação, alguns websites de clientes permaneceram indisponíveis depois de o EasyWP.com e o Dashboard terem sido restaurados, com alguns a devolver erros de ligação à base de dados.
Spacemail
Os serviços de email também foram afetados. Os clientes afetados não conseguiam enviar emails, e os emails recebidos não podiam ser entregues enquanto os servidores relevantes estiveram offline.
É importante referir que isto não significava que as mensagens recebidas fossem automaticamente perdidas. Normalmente, os fornecedores de email fazem novas tentativas de entrega quando um servidor de receção está temporariamente indisponível. Por isso, as mensagens chegariam, mas mais tarde do que o habitual.
Como restaurámos os serviços
A RadiusDC começou a restaurar a sua capacidade de arrefecimento o mais rapidamente possível, enquanto unidades de arrefecimento temporárias foram instaladas e direcionadas para a nossa área do centro de dados para ajudar a reduzir as temperaturas.
As nossas equipas trabalharam continuamente no local em conjunto com a RadiusDC para restaurar o arrefecimento. Só começámos a repor os serviços online quando as temperaturas regressaram a níveis de funcionamento seguros e estávamos confiantes de que não havia risco de sobreaquecimento ou de danos a mais longo prazo.
Com as condições seguras de funcionamento restabelecidas, iniciámos uma recuperação controlada em toda a nossa infraestrutura. Isto teve de acontecer de forma progressiva, por isso os clientes viram diferentes serviços regressar em momentos diferentes.
Porque é que os serviços foram restaurados por fases
A dimensão do incidente significou que diferentes partes da nossa plataforma foram afetadas ao mesmo tempo. Embora os clientes as experienciem como serviços separados, o incidente no centro de dados afetou a infraestrutura envolvida na prestação de vários deles.
Serviços como alojamento e email dependem de várias camadas de tecnologia, incluindo servidores, redes, armazenamento e bases de dados. Restaurá-los significou repor estes diferentes elementos online pela ordem certa, em vez de simplesmente voltar a ligar tudo de uma só vez.
O que acontece a seguir
Levamos esta interrupção e o seu impacto nos nossos clientes muito a sério.
As nossas equipas estão a realizar uma análise aprofundada da situação para reforçar os nossos sistemas e garantir que incidentes semelhantes não voltem a acontecer.
Seremos totalmente transparentes sobre o que aprendermos e partilharemos contigo os resultados, juntamente com as medidas que estamos a tomar.
CORREÇÃO: O operador do nosso centro de dados é a RadiusDC, e não a PhoenixNAP, como foi referido em várias publicações iniciais no X a 13 de agosto. A PhoenixNAP não está envolvida neste incidente.
Partilha a tua opinião