8月13日,我們經歷了一次重大服務中斷,影響了多項 Spaceship 服務。
原因是託管部分 Spaceship 核心營運的 RadiusDC:Phoenix 數據中心冷卻系統故障。為了保護客戶基礎設施免於過熱及可能損壞,我們被迫將服務下線。
目前,所有受此次事故影響的項目均已恢復,我們的團隊亦持續密切監察系統,以確保其保持穩定。
對於那些依賴我們提供網站、電郵及其他網上服務的客戶所受到的影響,我們深感抱歉。此次中斷所造成的影響,以及其背後的情況,我們都極為嚴肅看待。
發生了甚麼事
事故始於 Phoenix 數據中心因一場強烈風暴導致冷卻系統故障,使我們基礎設施周圍的溫度達到臨界水平。
在這種情況下繼續運行系統,會有設備過熱並遭受較長期甚至災難性損壞的風險。將服務下線造成了重大干擾,但這是保護客戶基礎設施所必需的。
在冷卻系統重新上線之前讓設備保持離線,也讓溫度在恢復開始前有時間回復至安全水平。這有助避免產生更多問題,否則可能會令本已嚴重的事故進一步延長。
客戶受到怎樣的影響
此次中斷影響了包括 Shared、VPS、電郵轉寄及 Spacemail 在內的服務。Spaceship.com 在整個事故期間一直保持在線。
以下是此次情況對主要產品和服務造成影響的概述:
主機營運
客戶存取網站及主機服務受到影響,許多客戶網站無法使用、速度緩慢,或返回錯誤。由於負責處理部分帳單作業的系統在事故期間被下線,部分帳單作業在之後亦無法使用。
EasyWP
EasyWP 的控制台及客戶網站受到干擾。在恢復期間,即使 EasyWP.com 和控制台已恢復,部分客戶網站仍然無法使用,其中一些還返回資料庫連線錯誤。
Spacemail
電郵服務亦受到干擾。受影響的客戶無法發送電郵,而在相關伺服器下線期間,傳入電郵亦無法投遞。
重要的是,這並不代表傳入訊息會自動遺失。當接收伺服器暫時無法使用時,郵件服務供應商通常會進一步嘗試投遞。因此,訊息最終會送達,但會比平常稍晚。
我們如何恢復服務
RadiusDC 盡快開始恢復其冷卻能力,同時安裝了臨時冷卻機,並將其導向數據中心內我們所在的區域,以協助降低溫度。
我們的團隊與 RadiusDC 一同在現場持續工作,以恢復冷卻系統。只有在溫度回復至安全運作水平,並且我們確信不存在過熱或較長期損壞風險後,我們才開始讓服務重新上線。
在安全運作條件恢復後,我們開始對基礎設施進行受控恢復。這需要逐步進行,因此客戶會看到不同服務在不同時間恢復。
為何服務分階段恢復
此次事故的規模意味著我們平台的不同部分同時受到干擾。雖然客戶會將這些視為獨立服務,但數據中心事故影響了提供其中多項服務所涉及的基礎設施。
主機和電郵等服務依賴多層技術,包括伺服器、網絡、儲存和資料庫。恢復這些服務意味著需要按正確順序讓這些不同元素重新上線,而不是一次過把所有東西重新開啟。
接下來會發生甚麼
我們非常重視此次中斷及其對客戶造成的影響。
我們的團隊正對情況進行全面檢討,以加強我們的系統,並確保類似事故不會再次發生。
我們會對所了解到的內容保持完全透明,並會與你分享結果,以及我們正在採取的行動。
更正:我們的數據中心營運商是 RadiusDC,而不是在 8 月 13 日於 X 上數則早期帖文中提及的 PhoenixNAP。PhoenixNAP 並未涉及此次事故。
分享您的想法