人类在对于灾难的承担与付出中,实现了向更高程度文明过渡的历程,数据中心的基础设施运维也是如此。如果说,处于高风险社会的事实,以暴乱、洪水、矿难、重大污染事件为标志的各类事故灾难类突发公共事件在近年来的集中发生,是对于中国当下政治、社会的重大考验。那么停电、停水、火灾、洪水等意外事件的发生,对于数据中心的连续不间断运营也提出了前所未有的挑战。 本文基于业界的最佳实践,对数据中心基础设施运维之应急处理的组织体系、运行机制、应急保障、监督管理等方面进行浅析,探讨了应急处理的目的及意义,给出了应急处理相关名词解释,分析了应急处理的基本原则,研究了应急处理体系建设方式及应急处理物资管理建议,最后本文针对数据中心几种典型场景,给出相应的应急处理建议,供读者参考借鉴。 读者可以根据自己的实际情况,对本文介绍的数据中心基础设施运维的应急处理进行完善、修改和补充,制定适合自己的数据中心基础设施的应急处理方案。 一、应急处理的目的及意义 为保障数据中心业务的连续运营,各类数据中心在硬件建设上通过设备及系统的冗余配置,使得数据中心的业务保障能力不断提高。但与此同时,据统计显示,全球每年仍有大量的数据中心由于基础设施运维的应急处理不当,造成部分或全部业务宕机。如何保障数据中心在意外事件发生后能做到有章可循、有据可依,要求各类数据中心必须建立明确的应急处理体系,其目的及意义探讨如下。 数据中心基础设施运维的应急处理体系确定了应急救援的范围和方法,使数据中心应急管理不再无据可依,无章可循,尤其是通过培训和演练,可以使数据中心应急人员熟悉自己的任务和角色定位,具备完成指定任务所需的相应能力,并检验预案和执行程序,评估应急人员的整体协调性。 数据中心基础设施运维的应急处理建设,有利于在突发事件来临时做出及时的应急响应,降低事故后果,应急行动对时间要求十分敏感,不允许有任何拖延,应急预案预先明确了应急各方职责和响应程序,在应急资源等方面进行先期准备,可以指导应急救援迅速、高效、有序的开展,将事故造成的人员伤亡、财产损失、环境破坏、运行中断时间等降到最低限度。 数据中心基础设施运维的应急处理体系是数据中心各类突发事故的应急基础,通过编制应急预案,可以对那些事先无法预料到的突发事故起到基本的应急指导作用,成为开展应急救援的“底线”,在此基础上,可以针对特定事故类别编制专项应急预案,并有针对性地制定应急预案、进行专项应急预案准备和演习。 数据中心基础设施运维的应急处理体系,建立了与上级单位和部门应急救援体系的衔接,通过编制应急预案,可以确保当发生超过本级应急能力的重大事故时,与有关应急机构的联系和协调。 数据中心基础设施运维的应急处理体系建设,有利于提高风险防范意识,应急预案的编制、评审、发布、宣传、演练、教育和培训,有利于各方了解面临的重大事故及其相应的应急措施,有利于促进各方提高风险防范意识和能力。 二、应急处理相关名词解释
三、应急处理的基本原则 数据中心基础设施运维应急处理应遵循以下原则:
四、应急处理体系建设 1、应急体系建设 各类数据中心应针对本数据中心基础设施运维的特点,建立基础设施运维应急处理体系,应急体系建设原则如下: (1)总则:包括基础设施运维应急处理体系目的、工作原则、编制依据和适用范围。 (2)数据中心基础设施运维应急处理组织指挥体系及职责:包括组织机构和职责、组织体系框架描述。 (3)数据中心基础设施运维应急处理的预防和预警机制:包括对预防机制、预警监测、预防预警行动、预警分级和发布的介绍。 (4)数据中心基础设施运维应急处理的应急响应:说明应急响应的阶段划分、应急响应各阶段的工作内容和要求。 (5)数据中心基础设施运维应急处理的后期处置:包含情况汇报和经验总结、奖惩评定及表彰。 (6)数据中心基础设施运维应急处理的保障措施:从信息资源、人力资源、财力资源、物力资源四个方面,说明为应对突发或重要事件所应配备的资源及相应的管理办法。 (7)附则:包括名词术语和缩写语、预案的管理与更新、沟通与协作、制订与解释部门等内容。 2、应急预案制定 数据中心基础设施运维,要提前制定针对本数据中心的相关应急预案。数据中心基础设施运维应急预案的制定,要注意以下几个方面: (1)针对性。数据中心基础设施运维应急预案,是针对可能发生的事故,为迅速、有序地开展应急行动而预先制定的行动方案,因此,应急预案应结合危险分析的结果。
(2)科学性。应急救援工作是一项科学性很强的工作,编制应急预案必须以科学的态度,在全面调查研究的基础上,实行领导和专家结合的方式,开展科学分析和论证,制定出决策程序和处置方案,应急手段先进的应急反应方案,使应急预案真正的具有科学性。 (3)可操作性。应急预案应具有实用性和可操作性,即发生重大事故灾害时,有关应急组织、人员,可以按照应急预案的规定,迅速、有序、有效地开展应急救援行动,降低事故损失。 (4)完整性。
(5)可读性。
(6)相互衔接性。各类针对各种场景的数据中心基础设施运维应急预案,应相互协调一致、相互兼容。 (7)规范性。数据中心基础设施运维应急预案的版本号建议采用“Vx.y.z(年份)”的形式表示。其中:V:表示版本,是"version"的简写;x:大版本更新,结构变化,每次更新数值加1;y:具体更改,部分内容的修正,每次更新数值加1;z:文字修改,奇数为包含对上一版修改记录的稿子,偶数为对上一版修改稿的定稿;年份:最新修改年限,如“2014”代表最新修改发生在2014年。 x、y、z均为非负整数。每当x加1时,y和z应清零。 五、应急处理之物资管理 为了提升数据中心基础设施运维质量,加强数据中心自有应急服务保障物资和装备的管理,确保数据中心各类业务保障工作的顺利开展,依据国家法律、行业规范,各类数据中心应制定适合本数据中心的基础设施运维应急物资管理办法。 1、应急物资管理原则 (1)数据中心基础设施运维应急物资,是指用于数据中心应对突发事件的业务保障和业务恢复工作所需的通信装备、电源设备、辅助装备、后勤保障装备和个体防护装备等。 (2)应急物资管理遵循“统筹管理、科学分布、合理储备、统一调度、分级负责”的原则。 2、应急物资的存储 数据中心基础设施运维应急物资存储工作,应遵循“统筹规划、分区储备、保障急需、方便调度、专业管理”原则。 根据数据中心基础设施运维保障需要,各数据中心基础设施运维部门要选用固定的应急物资存储地点,确保应急物资“灵活、方便、快捷”地存储和调用。各储备点应满足以下要求: (1)选址在交通便利,供电可靠,周围没有明显的安全隐患,不易受洪涝、山体滑坡等影响。 (2)满足“四防”要求:防盗、防火、防水、防潮。 (3)储备点需设置操作维护空间,便于应急设备的检修、测试等。 3、应急物资的维护 (1)数据中心基础设施运维相关应急物资的日常维护工作,由数据中心应急物资储备部门负责,应参照各数据中心相关维护规程制定具体的应急物资维护细则并严格执行。 (2)数据中心基础设施运维相关应急物资储备部门,要加强应急物资维护管理,根据储备物资的有效期和质量要求对储备物资进行保养和适时轮换,确保应急物资的可用性和完好率。 (3)数据中心应急保障车辆应制定专门的安全生产管理办法,车辆的保养和检修频次应高于车辆保养手册的要求,五年以上车辆应将保养里程或者时间减少一半以上。 (4)数据中心应急保障设备至少应每年检修和保养一次,各类重型设备应每半年在本数据中心灾害高发季节之前及结束之后进行检修和保养一次。 (5)专业管理部门牵头负责应急物资,特别是备品备件的性能检查和升级,至少应每半年进行应急物资的软件、硬件与数据中心现行设备的同步更新和升级。 (6)数据中心各级基础设施维护部门应提出应急物资维护支出预算,对执行情况进行跟踪。 (7)数据中心应急物资报废按照《数据中心固定资产管理办法》有关固定资产报废的相关规定执行。数据中心各级基础设施运维部门应在应急物资报备时上报物资报废情况。 六、应急处理之应急演练 为确保数据中心基础设施维护工作的顺利开展,保障数据中心基础设施安全、机房设备稳定运行,进一步验证安防、消防、动力、空调、综合监控等系统在突发情况下的运行状态,为各项操作规程和应急预案的编制奠定基础,提升维护人员的现场实际操作能力和应急能力,日常的应急演练显得尤为重要,各类数据中心应当重视应急演练,切实防患未然。 1、应急演练的目的和意义 为提高数据中心发生突发安全生产事故时,维护人员的快速反应能力,检验及维护在非正常状态下的组织能力,缩短处理事故的时间,减少事故状态下的经济损失,各类数据中心应当本着“安全第一,预防为主”的方针,组织进行数据中心基础设施应急演练。通过数据中心意外事件的实战演练,为日后数据中心基础设施故障处理积累经验。通过应急演练,查找目前存在的薄弱环节,采取措施进行补救和提高,以保证在意外状态下正确快速地处理异常状况,保证数据中心基础设施安全运行。数据中心各专业应急演练,应参照应急演练的总体部署。 2、应急演练的组织原则 (1)制定详细的应急演练方案。凡事预则立,不预则废。数据中心基础设施运维之应急演练亦是如此,基础设施运维各专业应密切结合本专业实际,制定详细的应急演练计划,对可预见的场景应提前做好应急演练部署。应急演练方案应包括以下内容:
(2)应急演练严格落实。按照数据中心演练计划,基于上述详实的演练方案,在演练执行的过程中要认真落实,严格监控演练各环节的落实情况,不断优化此类应急演练的方案和流程,将数据中心应急演练工作常态化,随时保持警惕,真正做到“平战结合”。 (3)应急演练经验总结和提升。应急演练执行完毕后,善于总结,将成功的经验及方法及时总结归纳,及时输出应急演练报告,重要文献应纳入数据中心文档库、资料库、案例库。在演练过程中发现的问题及时给出解决方案并落实解决,应急演练过程中的优秀参演维护单位和部门应予以表彰。 3、应急演练小结 综上,应急演练工作的开展,是数据中心基础设施运维中不可或缺的重要部分,演练执行过程中加强“四点”管理,即抓住重点、克服难点、控制节点、保证终点;要求“科学运维、智慧演练”。 数据中心基础设施应急演练,应围绕各项工作的目标要求,增强应急演练工作的计划性和主动性,坚决贯彻“12个有”:即各项应急演练工作开展之前要“有目标、有计划、有要求”,应急演练工作开展之中要“有人抓、有人管、有落实”,“有制度、有流程、有手段”,应急演练工作完成之后要“有总结、有考核、有提升”。 (本文节选自《中国数据中心运维管理指针》,如需购买或转载请留下您的联系电话及邮箱发送留言至本公众号,将有工作人员与您联系) |
|