讓託管基礎設施配合業務持續目標
業務持續目標說明企業在正常運作受干擾時,需要維持、恢復或保護哪些服務,以及可承受多久的中斷。託管基礎設施不是單純的技術成本項目,也是業務持續目標的一部分。
具韌性的規劃,需要把業務優先次序與伺服器、網絡、儲存、保安、支援及復原程序連接起來。合適的設計不是設備最多,而是在實際情況下,能符合已訂立的復原時間、復原點及可用性要求。
從業務持續目標開始
業務持續規劃應由企業不能承受長時間中斷的服務開始,而不是由預設的伺服器規格開始。按業務影響、客戶依賴程度、資料敏感度及長時間停機的後果,為應用程式排序。
- 列出在服務中斷時仍必須維持的服務。
- 為每項重要工作負載訂立復原時間目標(RTO)及復原點目標(RPO)。
記錄 DNS、身份認證、資料庫、儲存、網絡路由、付款系統及第三方整合等依賴項目。
提示:如果所有工作負載都被標記為最重要,代表優先次序仍未清楚定義。
把業務目標轉化為基礎設施要求
工作負載排序後,便要把每項目標轉化為營運要求。RTO較短的應用程式,可能需要熱備用、自動故障轉移或第二個地點;復原時間較寬裕的工作負載,則可以從已驗證的備份恢復,但前提是復原流程曾經測試。
- 按服務層級,配對所需的運算、記憶體、儲存、網絡及保安容量。
- 記錄復原服務所需的人員、權限、供應商支援及操作手冊。
這樣可以避免業務持續規劃變成一套一般性的控制措施,也能揭示企業期望與現有環境實際能力之間的差距。備份可能符合RPO,但如果沒有經測試的復原流程,RTO仍然不切實際。
以專屬伺服器建立可預測的基礎
當企業需要獨享資源、管理控制權及穩定的關鍵工作負載基線時,專屬伺服器可以支援業務持續規劃。在選定設計前,可參考 Dataplugs 的 專屬伺服器方案,並一併評估處理器、記憶體、儲存、網絡容量、位置及遠端管理要求。
- 獨享的處理器、記憶體、儲存及網絡資源,令效能更容易建立基線及監控。
- 對實體伺服器有更多控制,可以簡化作業系統配置、保安加固、備份代理程式及復原測試。
專屬伺服器本身並不是業務持續計劃,仍需要具韌性的電力及網絡連接、經驗證的備份、受控權限、清晰的責任分工,以及記錄完整的服務復原路徑。
按故障範圍設計冗餘
冗餘設計應針對企業希望承受的故障類型。第二部位於同一機櫃的伺服器,或可應付硬件故障,但未必能抵禦機房中斷、網絡故障、區域性事件或共同配置錯誤。
可參考 主機代管與業務持續規劃,評估獨立機房、地理位置、電力設計、網絡連接及遠端支援如何加強復原架構。
- 把主要及復原資源分布在有實際意義的故障範圍。
- 即使主要環境無法使用,也要保留復原所需的權限、管理路徑及文件。
冗餘程度取決於每項工作負載的價值及復原要求。在所有地方建立相同架構,可能增加成本,卻未必改善真正重要的風險。
提示:說明每項冗餘組件要應付的故障,然後測試相應的復原路徑。
把網絡韌性納入設計
即使伺服器保持正常,業務持續仍可能失敗。電訊商故障、路由變更、防火牆錯誤、DNS問題或鏈路飽和,都可能令原本可用的應用程式無法連接。因此,網絡設計與選擇伺服器一樣需要優先處理。
- 如工作負載有需要,使用多元化連接、獨立路徑或經測試的故障轉移路由。
- 分開生產、管理、備份及複製流量,避免單一流量耗盡所有可用容量。
從相關地點測量故障轉移時間、DNS表現、連線恢復、資料複製延遲及使用者可達性。架構圖上的冗餘,仍可能共用電訊商、機房或配置依賴。
保護備份及復原資料
復原不只是擁有一份資料副本。備份必須完整、可存取、避免未經授權的修改,並且能與所依賴的應用程式及基礎設施一同使用。
- 保留多於一份復原副本,並把至少一份副本與主要環境隔離。
- 保護備份權限,並測試檔案、資料庫、配置及權限能否一併還原。
記錄保留期、複製延遲、加密、資料位置,以及有權批准復原的人員。
把復原營運與日常營運分開
當復原工作與生產流程互相競爭,業務持續工作會更困難。應把備份驗證、映像建立、修補程式測試及復原演習納入受控及有安排的流程,並預留足夠資源,避免影響現行服務。
- 使用貼近實際測試、但足夠隔離以降低營運風險的復原環境。
- 在主要環境以外,保存最新的操作手冊、聯絡方法、存取方式及基礎設施圖。
復原團隊應清楚知道如何按正確次序重建或還原依賴項目。記錄所有假設、前置條件,以及何時需要由業務負責人批准故障轉移或返回正常運作。
為託管事故做好準備
硬件故障只是其中一種業務持續情境。權限被入侵、惡意軟件、DDoS攻擊、錯誤變更或管理介面外洩,都可能中斷服務,並令人無法確定還原後的系統是否可信。
- 定義誰可以宣佈事故、隔離系統、批准緊急變更,以及向客戶或持份者發出通知。
- 在可行情况下,先保存記錄、快照、配置歷史及證據,才進行會破壞資料的修復。
Dataplugs 的 託管基礎設施事故應對規劃指南,可供企業參考如何制定偵測、責任分工、遏制、復原、溝通及事故後檢討流程。相關原則仍應按企業實際架構及責任調整。
測試目標,而不只是測試設備
業務持續設計只有能證明預期結果,才算可信。測試完整的服務路徑,包括應用程式啟動、依賴項目、網絡存取、身份認證、資料完整性及使用者通知。
- 進行桌上演練,確認責任、升級路徑、決策及溝通安排。
- 進行技術復原測試,量度實際RTO、RPO、故障轉移時間及服務表現。
每次演練後,記錄失敗事項、超出預期的時間,以及需要更改的假設。測試也應包括返回主要環境;無法安全逆轉的緊急故障轉移,可能造成第二次中斷。
提示:量度使用者再次可以使用服務的時間,不只是伺服器重新可連接的時間。
平衡韌性、成本及營運工作
最強的業務持續設計不一定是最昂貴的方案。應把冗餘硬件、額外地點、網絡多元化、備份容量、監控、支援及定期測試的成本,與停機對業務造成的影響比較。
按工作負載的重要程度分層安排控制措施。面向客戶的交易系統,可能值得採用較短RTO及地理分隔的復原環境;內部存檔則可能只需要可靠備份及記錄清楚的還原流程。當應用程式、供應商、資料量及服務期望改變時,也要重新檢視設計。
總結
讓託管基礎設施配合業務持續目標,代表把業務影響連接到可量度的技術結果。伺服器、網絡、儲存、保安、支援及復原程序,都應按哪些服務必須維持、需要多快恢復,以及企業可以承受重建多少資料來選擇。
專屬伺服器可以提供受控而可預測的基礎,而冗餘、主機代管、經測試的備份、事故應對及實際演練,才可把這個基礎轉化為可運作的業務持續計劃。Dataplugs 可以協助企業按工作負載、位置、連接及復原要求,評估專屬伺服器環境。
如需了解更多資料,請瀏覽 Dataplugs 網站或聯絡 sales@dataplugs.com。
