8월 13일, 여러 Spaceship 서비스에 영향을 미친 대규모 서비스 장애가 발생했습니다.
원인은 일부 핵심 Spaceship 운영이 호스팅되는 RadiusDC: Phoenix 데이터 센터의 냉각 시스템 장애였습니다. 이로 인해 과열 및 잠재적 손상으로부터 고객 인프라를 보호하기 위해 서비스를 오프라인으로 전환해야 했습니다.
이제 사고의 영향을 받은 모든 것이 복구되었으며, 저희 팀은 시스템이 안정적으로 유지되도록 계속 면밀히 모니터링하고 있습니다.
웹사이트, 이메일 및 기타 온라인 서비스를 위해 저희를 신뢰하는 고객 여러분께 끼쳐드린 영향에 대해 깊이 사과드립니다. 이로 인해 발생한 장애와 그 배경 상황을 저희는 매우 엄중하게 받아들이고 있습니다.
무슨 일이 있었는가
이번 사고는 큰 폭풍으로 인해 Phoenix 데이터 센터의 냉각 시스템이 고장 나면서 시작되었고, 그 결과 저희 인프라 주변의 온도가 위험 수준에 도달했습니다.
이러한 조건에서 시스템 운영을 계속하면 장비가 과열되어 장기적이고 치명적인 손상을 입을 위험이 있었습니다. 서비스를 오프라인으로 전환하면서 상당한 장애가 발생했지만, 고객 인프라를 보호하기 위해 필요한 조치였습니다.
냉각 시스템이 다시 온라인 상태가 될 때까지 장비를 오프라인으로 유지한 것은 복구가 시작되기 전에 온도가 안전한 수준으로 돌아갈 시간을 확보하는 데에도 도움이 되었습니다. 이는 이미 심각한 사고를 더 오래 끌 수 있었던 추가 문제의 발생을 피하는 데 도움이 되었습니다.
고객에게 미친 영향
이번 장애는 Shared, VPS, 이메일 포워딩 및 Spacemail을 포함한 서비스에 영향을 미쳤습니다. Spaceship.com은 사고 기간 내내 온라인 상태를 유지했습니다.
다음은 이 상황이 주요 제품 및 서비스에 어떤 영향을 미쳤는지에 대한 요약입니다:
호스팅 운영
고객의 웹사이트 및 호스팅 서비스 접근이 영향을 받았으며, 많은 고객 웹사이트가 사용할 수 없거나 느리게 작동하거나 오류를 반환했습니다. 청구 처리를 담당하는 시스템이 사고 중 오프라인으로 전환되면서 일부 청구 작업도 이용할 수 없었습니다.
EasyWP
EasyWP의 대시보드와 고객 웹사이트에 장애가 발생했습니다. 복구 중에는 EasyWP.com과 대시보드가 복원된 후에도 일부 고객 웹사이트를 계속 사용할 수 없었고, 일부는 데이터베이스 연결 오류를 반환했습니다.
Spacemail
이메일 서비스도 장애를 겪었습니다. 영향을 받은 고객은 이메일을 보낼 수 없었고, 관련 서버가 오프라인 상태인 동안 수신 이메일도 전달될 수 없었습니다.
중요한 점은 이것이 수신 메시지가 자동으로 손실되었다는 뜻은 아니라는 것입니다. 일반적으로 메일 제공업체는 수신 서버를 일시적으로 사용할 수 없을 때 추가 전달을 시도합니다. 따라서 메시지는 도착했지만 평소보다 늦었습니다.
서비스를 복구한 방법
RadiusDC는 가능한 한 빨리 냉각 용량 복구를 시작했으며, 동시에 임시 냉각 장치를 설치해 데이터 센터 내 우리 구역으로 냉기를 보내 온도를 낮추도록 했습니다.
저희 팀은 냉각을 복구하기 위해 현장에서 RadiusDC와 함께 지속적으로 작업했습니다. 온도가 안전한 운영 수준으로 돌아왔고 과열이나 장기적인 손상 위험이 없다고 확신한 후에야 서비스를 다시 온라인으로 전환하기 시작했습니다.
안전한 운영 조건이 복원되자 저희는 인프라 전반에 걸쳐 통제된 복구를 시작했습니다. 이는 점진적으로 진행되어야 했기 때문에 고객마다 서로 다른 시점에 각기 다른 서비스가 복구되는 것을 보게 되었습니다.
서비스가 단계적으로 복구된 이유
사고 규모가 컸기 때문에 플랫폼의 여러 부분이 동시에 장애를 겪었습니다. 고객은 이를 별개의 서비스로 경험하지만, 데이터 센터 사고는 그중 여러 서비스를 제공하는 데 관련된 인프라에 영향을 미쳤습니다.
호스팅 및 이메일과 같은 서비스는 서버, 네트워크, 스토리지, 데이터베이스를 포함한 여러 기술 계층에 의존합니다. 이를 복구하려면 모든 것을 한 번에 다시 켜는 것이 아니라, 이러한 서로 다른 요소를 올바른 순서로 다시 온라인 상태로 전환해야 했습니다.
다음 단계
저희는 이번 장애와 그것이 고객에게 미친 영향을 매우 गंभीर하게 받아들이고 있습니다.
저희 팀은 시스템을 강화하고 유사한 사고가 다시 발생하지 않도록 하기 위해 이번 상황을 철저히 검토하고 있습니다.
저희는 이번에 알게 된 내용을 완전히 투명하게 공개하고, 저희가 취하고 있는 조치와 함께 그 결과를 여러분과 공유하겠습니다.
정정: 저희 데이터 센터 운영사는 RadiusDC이며, 8월 13일 X의 여러 초기 게시물에서 언급된 PhoenixNAP가 아닙니다. PhoenixNAP는 이번 사고와 관련이 없습니다.
귀하의 의견을 공유하세요