# CISP 业务连续性管理
本文是对 CISP 课程中 "业务连续性管理" 章节的系统性整理,涵盖信息保障技术框架、业务连续性管理(BCM)、信息安全应急响应、灾难备份与恢复四大模块。
# 一、信息保障技术框架(IATF)
# 1.1 概述
信息保障技术框架(Information Assurance Technical Framework, IATF)由美国国家安全局(NSA)制定,旨在为保护美国政府及工业界的信息与信息技术设施提供技术指南。其核心思想是深度防御(Defense in Depth),强调通过多层次、多维度的防护手段来确保信息安全。
# 1.2 三大要素
IATF 将信息保障体系归纳为三个核心要素:
| 要素 | 说明 | 主要内容 |
|---|---|---|
| 人(People) | 信息保障体系的核心,是第一位的要素,同时也是最脆弱的环节 | 意识培训、组织管理、技术管理、操作管理 |
| 技术(Technology) | 实现信息保障的重要手段,形成一个动态的技术体系 | 防护、检测、响应、恢复 |
| 操作(Operation) | 又叫运行,构成安全保障的主动防御体系,是将技术紧密结合的主动过程 | 风险评估、安全监控、安全审计、跟踪告警、入侵检测、响应恢复 |
# 1.3 四个焦点领域
- 保护网络和基础设施 — 确保网络基础设施的安全
- 保护区域边界 — 在组织网络边界建立防护
- 保护计算环境 — 保障终端和服务器环境安全
- 支持性基础设施 — 包括 PKI、密钥管理、检测响应等支撑体系
# 1.4 信息系统安全保障评估框架
该框架强调:
- 风险和策略是安全保障的基础和核心
- 安全应贯彻信息系统的全生命周期
- 强调综合保障的观念,综合技术、管理、工程和人员保障要素
- 最终目的是实现安全的三个核心特征:保密性、完整性和可用性
信息系统生命周期包括:计划组织 → 开发采购 → 实施交付 → 运行维护 → 废弃。在生命周期的任何时间点上,都需要综合安全保障要素。
# 1.5 企业安全架构
企业安全架构是企业架构的一个子集,定义了信息安全战略,包括分层级的解决方案、流程和规程,确保安全工作以标准化和成本可控的方式与业务实践相结合。
常见的企业安全架构包括:
- SABSA(舍伍德的商业应用安全架构)
- Zachman 框架
- TOGAF(开放群组架构框架)
# SABSA 模型的六个层级
SABSA 是一个分层模型,从业务视角到底层技术,将安全架构分为六个层次:
| 层级 | 视图 | 关注点 |
|---|---|---|
| 背景层 | 业务视图 | 业务需求驱动,了解系统的业务需求 |
| 概念层 | 架构视图 | 整体概念设计,确定指导原则和基本概念 |
| 逻辑层 | 设计视图 | 系统工程的架构元素识别和规范 |
| 物理层 | 建设视图 | 实际的技术模式和系统组件详细设计 |
| 组件层 | 实施者视图 | 组件安全架构 |
| 运营层 | 服务和管理视图 | 运维管理、服务管理安全 |
# 二、业务连续性管理基础
# 2.1 核心概念
业务连续性(Business Continuity, BC) 是组织对事故和业务中断的规划与响应能力,使业务能够在预先定义的级别上持续运行。它是一种组织策略和技术能力的综合体现。
业务连续性管理(Business Continuity Management, BCM) 是找出对组织有潜在影响的威胁及其对业务运行的影响,通过有效响应措施保护组织利益、信誉、品牌和创造价值的活动,为组织提供建设恢复能力框架的整体管理过程。
BCM 的特点:
- 是一项综合管理流程,由业务驱动
- 集合了技术与管理的一体化动态管理流程
- 应为业务战略服务
- 是风险管理框架的补充,主要考虑业务中断的影响
# 2.2 BCM 生命周期
- 需求、组织和管理程序的确定
- 业务分析 — 确定关键业务流程和关键因素
- 制定业务策略
- 开发并执行业务持续计划
- 意识培养和建立
- 计划演练
# 三、业务连续性计划(BCP)
# 3.1 什么是 BCP
业务连续性计划(Business Continuity Plan, BCP)是一套基于业务运行规律的管理要求和规章流程,能够使组织在突发事件面前迅速做出反应,确保关键业务功能可以持续,而不造成业务中断或业务流程本质的改变。
BCP 的关键特征:
- 建立在对组织机构各种过程的风险评估之上
- 关注基础设施功能和资源减少或受限的情况下维持业务操作
- 应成为组织管理文化的一部分
- 当业务模式或过程变化时,应重新设计
# 3.2 组织管理
BCP 的组织管理包含四个要素:
- 理解业务组织 — 充分了解组织体系结构及其组成部分,清晰每个业务流程及相互依赖关系
- 建立 BCP 团队 — 负责人与团队成员明确分工
- 评估 BCP 资源 — 包括冗余设备、办公用品、以及开发、测试、培训和维护过程中的人力资源
- BCP 的合规性要求 — 法律法规合规性、合同合规性
# 3.3 业务影响分析(BIA)
业务影响分析(Business Impact Analysis, BIA)是 BCP 的核心环节,其目标是:
- 确定组织持续运行的关键资产
- 针对这些资产的威胁进行评估
- 评估每种资产面临的威胁对业务的影响
- 提供量化度量以确定资源投入的优先顺序
# 工作内容
- 确定业务优先级 — 编制业务流程综合列表,按重要性排序
- 风险分析
- 资产优先级划分
- 业务影响分析 — 之后文档化所有流程
# 确定业务优先级的关键点
- 评估业务中断后随时间推移对组织造成的影响
- 为每项业务建立最大允许中断时间(MTD)
- 识别相互依赖的活动、资产以及支持性基础设施和资源
# 重要指标
恢复时间目标(RTO, Recovery Time Objective) — 从业务中断到完全恢复的可容忍时长,是衡量业务连续性的核心指标。
# 3.4 制定与批准实施
# 风险处置方式
BCP 制定时需确定要处理的风险及措施,有四种风险处置方式:
| 方式 | 说明 |
|---|---|
| 风险降低 | 采取措施减少风险发生的可能性或影响程度 |
| 风险转移 | 通过保险或外包等方式将风险转移给第三方 |
| 风险规避 | 避免可能带来风险的活动或业务 |
| 风险接受 | 接受风险,但在接受前需充分了解其潜在影响 |
# 3.5 文档化
文档化是 BCP 过程中的关键步骤。文档须包含以下内容:
- BCP 的目标 — 必须细化
- 职责声明 — 确保相关人员了解其职责
- 优先级声明
- 风险评估
- BCP 策略
- 关键业务记录计划
- 应急响应的指导原则
- 测试与演练
# 3.6 批准与实施
- 向高层汇报并获得计划的批准
- 对所有涉及人员进行培训和教育
# 3.7 评估与维护
业务的动态性决定了业务连续性要求也会随时改变。需定期讨论、复审和审视测试结果,必要时进行版本更新。
# 四、信息安全应急响应
# 4.1 信息安全事件与应急响应
信息安全事件是指由于自然或人为以及软硬件本身缺陷或故障的原因,对信息系统造成危害,或者在信息系统内发生对社会造成负面影响的事件。
应急响应是组织为了应对突发或重大信息安全事件的发生所做的准备,以及在事件发生后所采取的措施。
应急响应工作已被列为我国信息安全保障工作的重点之一。
# 4.2 应急响应组织架构
# 国际层面
- CERT/CC(计算机应急响应协调中心)
# 国家层面
- CNCERT/CC(国家计算机网络应急技术处理协调中心)
# 组织机构层面
- 应急响应领导组
- 应急响应技术保障组
- 应急响应专家组
- 应急响应实施组
- 应急响应日常运行组
# 4.3 国家政策与相关标准
- 中办发〔2003〕27 号文 — 首次正式提出信息安全保障工作要点,包括等级保护、密码技术、监控体系、应急处理等
- GB/T 24363-2009《信息安全应急响应计划规范》
- GB/T 20988-2007《信息系统灾难恢复规范》
- GB/Z 20985-2007《信息安全事件管理指南》
- GB/Z 20986-2007《信息安全事件分类分级指南》
# 4.4 信息安全事件分类分级
# 分类(GB/Z 20986-2007)
七个基本类别:
| 类别 | 示例 |
|---|---|
| ① 有害程序事件 | 病毒、蠕虫、木马 |
| ② 网络攻击事件 | DOS、后门攻击、扫描、钓鱼 |
| ③ 信息破坏事件 | 信息被篡改、假冒、窃取 |
| ④ 信息内容安全事件 | 危害国家安全、社会稳定 |
| ⑤ 设备设施故障 | 软硬件自身故障、人为非技术破坏 |
| ⑥ 灾害性事件 | 自然灾害、战争 |
| ⑦ 其他信息安全事件 | 不能归为以上 6 类的事件 |
# 分级
| 等级 | 名称 | 判定标准 |
|---|---|---|
| 1 级 | 特别重大事件 | 特别重要信息系统遭受特别严重损失,产生特别重大社会影响 |
| 2 级 | 重大事件 | 特别重要信息系统遭受严重损失,或重要信息系统遭受特别严重损失,产生重大社会影响 |
| 3 级 | 较大事件 | 重要信息系统遭受严重损失,或一般信息系统遭受特别严重损失,产生较大社会影响 |
| 4 级 | 一般事件 | 不满足以上条件,产生一般社会影响 |
# 4.5 应急响应六阶段
# 第一阶段:准备
目标: 确定重要资产和风险,实施防护措施,编制和管理应急响应计划。
具体包括:
- 应急响应计划的编制准备
- 编制应急响应计划
- 测试、培训演练和维护
- 为响应组织准备相关资源(人力、财力、物质、技术、社会关系等)
# 第二阶段:检测
目标: 检测并确认事件的发生,确定事件性质和影响。
工作内容:
- 进行监测、报告及信息收集
- 确定事件类别和级别
- 指定事件处理人,进行初步响应
- 评估事件影响范围
- 事件通告(信息通报、信息上报、信息披露)
# 第三阶段:遏制
目标: 限制事件影响的范围和损失。
工作内容:
- 启动应急响应计划
- 确定适当的响应方式
- 实施遏制行动
- 要求用户按应急行为规范配合
# 第四阶段:根除
目标: 采取长期的补救措施,避免问题再次发生。
工作内容:
- 详细分析,确定原因
- 实施根除措施,消除原因
# 第五阶段:恢复
目标: 恢复系统至正常状态。
工作内容:
- 根据破坏程度决定在原系统还是备份系统中恢复
- 按恢复优先顺序恢复系统和业务运行
# 第六阶段:跟踪总结
目标: 回顾并汇总事件相关信息。
工作内容:
- 关注系统恢复后的安全状况,记录跟踪结果
- 评估损失和响应措施效果
- 分析和总结经验教训
- 重新评估和修改安全策略、措施和应急响应计划
- 对进入司法程序的事件进一步调查
- 编制并提交应急响应报告
# 4.6 应急响应预案
应急预案是在分析突发事件后果和应急能力的基础上,针对可能发生的重大突发事件,预先制定的行动计划或应急对策。
编制要点:
- 建立在综合防灾规划之上
- 描述支持应急操作的技术能力,并适应组织要求
- 在详细程度和灵活程度之间取得平衡
- 为不熟悉计划的人员提供快捷明确的指导
预案格式可参考《国家网络安全事件应急预案》,应包括:总则、角色及职责、预防和预警机制、应急响应流程、应急响应保障措施和附件。
# 4.7 计算机取证
计算机取证是使用先进技术和工具,按照标准规程全面检查计算机系统,以提取和保护有关计算机犯罪相关证据的活动。
# 基本原则
- 合法原则
- 充分授权原则
- 优先保护证据原则
- 全程监督原则
# 取证流程
- 准备 — 获取授权、明确目标、准备工具软件和介质
- 保护 — 保证数据安全性(制作磁盘映像,不在原始磁盘上操作)、完整性、第三方监督
- 提取 — 优先提取易消失证据(内存信息、系统进程、网络连接、临时文件、缓存),再提取文件系统和应用系统数据
- 分析 — 寻找日志、删除的文件、临时文件、缓存中的证据,进行关联分析
- 提交 — 必须与现实取证结合,文档化非常重要
# 五、灾难备份与恢复
# 5.1 历史与背景
起源:
- 2000 年 **"千年虫" 问题 ** 引发国内首次集体关注(早期系统用两位数表示年份,如 98 代表 1998,2000 年时无法用 00 表示导致系统崩溃)
- 2001 年 "9・11" 事件真正推动全球对灾备的重视
发展历程:
- 90 年代末:仅关注数据备份
- 2000 年后:理论水平、技术能力和专业人才逐步成熟
灾难的定义: 需区分灾难与普通事件。机房完全瘫痪(如地震、全市停电)才构成灾难,单台服务器宕机不算。
# 5.2 核心概念
本质目的: 确保关键业务持续运行,最大限度减少非计划停机时间。
核心区别:
- 灾难备份 — 侧重数据保护的基础工作
- 灾难恢复 — 需同时考虑信息系统和业务功能的全面恢复
- 恢复计划 — 明确任务分工、行动流程、所需资源及数据的指导性文件
# 5.3 灾备关键指标
# RPO(Recovery Point Objective,恢复点目标)
定义本质: 允许丢失的最大数据量,即从最后一次备份到灾难发生时的时间差。
实例说明: 若 10 点备份后 12 点发生灾难,而下次备份在 14 点,则丢失 10:00~12:00 的数据(RPO=2 小时)。
零丢失方案:
- 需采用实时备份技术(如 CDP 持续数据保护)
- 实现方式:数据变化立即备份,任何时间点都可恢复
- 成本考量:需要高性能存储和网络带宽支持
# RTO(Recovery Time Objective,恢复时间目标)
业务视角: 从业务中断到完全恢复的容忍时长(如允许 1 小时停机)。
基础设施: 通过 UPS 供电组数、柴油发电机等硬件配置决定。
零中断方案:
- 需建设异地双活数据中心(如两地三中心架构)
- 切换机制:主中心故障时自动切换到备用中心(用户可能感知短暂延迟)
- 极限成本:需投入冗余硬件、专用软件和运维团队
指标关系:
- RPO 关注数据完整性
- RTO 关注业务连续性
- 同时实现 RPO=0 和 RTO=0 需要容灾级投入
# 5.4 灾备组织架构
# 核心小组
- 领导组 — 决策层负责战略规划
- 规划实施组 — 含外部专家进行方案设计
- 日常运行组 — 可外包给专业机构
# 协作单位
- 基础设施 — 电信、电力部门保障
- 专业支持 — 系统审计、媒体沟通团队
# 5.5 国家灾备政策与标准
- 27 号文:首次正式提出灾备概念
- 《重要信息系统灾难恢复指南》:明确等级划分和预案框架
- GB/T 20988-2007:规定恢复流程和方案设计要求
- 《灾难恢复中心建设与运维管理规范》:覆盖全生命周期管理
# 5.6 存储技术
# DAS(Direct Attached Storage,直连存储)
通过硬件堆叠直接在服务器上扩展硬盘,依赖计算机运行,不带独立操作系统。
| 优点 | 缺点 |
|---|---|
| 适用于物理位置分散的场景 | "忙闲不均",无法集中管控 |
| 易实现大容量存储且性能较高 | 对服务器依赖性强,占用服务器资源 |
| 实施简单,成本较低(如 RAID 3-5 块硬盘) | 扩展性差(需物理更换更大硬盘) |
# NAS(Network Attached Storage,网络附加存储)
通过网络接口连接,具有独立 IP 和操作系统,通过 CIFS/NFS 协议映射为网络目录或盘符。
| 优点 | 不足 |
|---|---|
| 易于安装部署和管理 | 性能受网络传输影响 |
| 不占用服务器资源,支持跨平台 | 可能影响网络流量 |
| 空间可随时调整 | 存在数据泄漏风险 |
# SAN(Storage Area Network,存储区域网络)
需要专用 SAN 交换机、光纤通道和 HBA 卡,通过光纤将存储映射为服务器本地硬盘。
| 优点 | 缺点 |
|---|---|
| 专用网络效率高 | 实施复杂难度大 |
| 扩展方便 | 成本高昂 |
| 支持远距离传输 | 需要专业维护 |
# 5.7 备份技术
# 备份方式
| 方式 | 原理 | 特点 |
|---|---|---|
| 完全备份 | 全量复制所有数据 | 首次备份时使用 |
| 增量备份 | 只备份上次备份后变化的内容 | 备份快但恢复慢,需按顺序还原所有增量;中间丢失会导致数据不完整 |
| 差分备份 | 始终基于首次完全备份的差异 | 备份慢但恢复快,只需还原完全备份和最近差分 |
# 备份介质
| 介质 | 特点 |
|---|---|
| 磁带 | 对勒索病毒免疫(需专用软件读写),适合离线备份,恢复需要转换过程 |
| 硬盘 / NAS/SAN | 存在被攻击风险,适合在线备份,恢复速度快 |
最佳实践: 采用 "3-2-1" 原则 — 3 份备份,2 种不同介质,1 份离线存放。
# RAID 冗余磁盘阵列
| 级别 | 特点 | 容错能力 |
|---|---|---|
| RAID-0 | 条带化提高性能 | 无容错能力 |
| RAID-1 | 磁盘镜像 | 确保数据不丢失 |
| RAID-5 | 3 块以上磁盘,带奇偶校验 | 允许单盘损坏 |
# 5.8 备用场所
| 类型 | 配置 | 切换时间 |
|---|---|---|
| 冷站 | 仅提供基础设施,无 IT 设备 | 长 |
| 温站 | 配备部分硬件,处于维护状态 | 中等 |
| 热站 | 完整设备 + 人员 | 快(需手动切换) |
| 镜像站 | 双活架构 | 自动切换,业务零中断 |
| 移动站 | 车载移动方案,通过 5G / 卫星通信 | 灵活 |
# 5.9 灾备等级标准
# 国际标准 SHARE78
| 等级 | 说明 |
|---|---|
| 0 级 | 无异地备份 |
| 1 级 | 简单异地备份 |
| 2 级 | 热备中心备份 |
| 3 级 | 电子传输备份 |
| 4 级 | 自动定时备份 |
| 5 级 | 实时数据备份 |
| 6 级 | 数据零丢失(需业务零中断) |
# 我国《重要信息系统灾难恢复指南》六等级
| 等级 | 核心特征 | 数据备份 | 备用场地 | 切换能力 |
|---|---|---|---|---|
| 1 级 | 基本支持 | 每周至少一次,场外存放 | 介质存放场地 | — |
| 2 级 | 备用场地支持 | 每周至少一次,场外存放 | 有运作场地 | 紧急调配 |
| 3 级 | 电子传输 + 部分设备 | 每天至少一次,每天多次定时传输 | 完整运作场地 | 专职管理人员 |
| 4 级 | 电子传输 + 完整设备 | 每天至少一次,多次传输 | 7×24 场地 | 全部设备就绪 |
| 5 级 | 实时数据传输 | 实时远程数据复制 | 7×24 场地 | 自动 / 集中网络切换 |
| 6 级 | 数据零丢失 + 远程集群 | 数据零丢失,实时备份 | 7×24 场地 | 实时无缝切换(≤2 分钟) |
关键要点:
- 等级越高,RTO/RPO 要求越严格
- 6 级要求 RTO ≤ 30 分钟,RPO = 0
- 5 级的 "关键数据零丢失" 并非全部数据,而 6 级要求全部数据零丢失
- 实施成本随等级呈指数级增长
# RTO/RPO 与所需灾难恢复能力级别的关系
| RTO | RPO | 所需级别 |
|---|---|---|
| 48 小时以上 | 1-7 天 | 1 级 |
| 24-48 小时 | 1-7 天 | 2 级 |
| 12-24 小时 | 数小时 - 1 天 | 3 级 |
| 2-12 小时 | 数小时 - 1 天 | 4 级 |
| 30 分钟 - 2 小时 | 0-30 分钟 | 5 级 |
| < 30 分钟 | 0 | 6 级 |
# 5.10 组织容灾策略构建
容灾策略分为三个层次,层层递进:
- 数据容灾(首要前提)— 可采用备份一体机或传统数据库备份,CDP 技术实现实时备份
- 系统容灾(基本基础)— 确保系统级冗余和快速恢复能力
- 应用容灾(主要关键)— 保障业务连续性,常采用双活架构实现
# 5.11 灾难恢复规划的管理过程
# 需求分析
核心指标:先确定 RTO 和 RPO。
业务影响分析:
- 识别关键业务功能及支持系统
- 量化系统中断造成的业务损失
- 梳理业务系统内外部依赖关系
- 计算各业务功能恢复的最小资源需求
恢复优先级示例:
| 系统 | 优先级 | RTO | RPO |
|---|---|---|---|
| 局域网服务器 | 高 | ≤ 1h | ≤ 3h |
| 广域网访问 | 中 | — | — |
| Email 服务 | 高 | ≤ 1d | ≤ 3d |
# 策略实现核心要素
- 数据备份系统 — 范围、间隔、技术及介质要求
- 备用基础设施 — 距离、场地环境、运行管理要求
- 专业技术支持 — 明确策略要求,建立技术团队
- 运维管理能力 — 建立操作规程和应急响应机制
# 灾备中心选址原则
- 规避与生产中心同风险区域
- 确保通信、电力、交通条件完备
- 采用 "统筹规划、资源共享、平战结合" 策略
同城 vs 异地:
| 对比项 | 同城 | 异地 |
|---|---|---|
| 距离 | 数十公里内 | 数百公里以上 |
| 备份方式 | 支持同步备份 | 只能异步备份 |
| 抗灾能力 | 弱(无法抵御区域性灾难) | 强 |
| 成本 | 相对低 | 较高 |
# 双活架构实现
- 数据同时发送至生产中心和灾备中心
- 两中心间进行数据比对和同步
- 生产中心故障时自动切换至灾备中心
# 灾难恢复预案管理
关键组成:
- 风险场景描述和业务影响分析
- 预防策略和恢复策略说明
- 关键应用系统优先级排序
- 详细行动计划和职责分工
演练实施:
- 按方式分:桌面演练、模拟演练、实战演练
- 按深度分:数据级、应用级、业务级演练
- 按准备情况:计划内演练和计划外演练
# 总结
业务连续性管理是一个涵盖战略规划、组织管理、技术实现和持续改进的综合管理体系。从 IATF 的深度防御思想出发,通过 BCP 的制定与执行,配合信息安全的应急响应机制,再到灾难备份与恢复的技术实现,形成了完整的业务连续性保障闭环。
核心要点回顾:
- BCM 是风险管理框架的补充,重点关注业务中断的影响
- BCP 的核心在于业务影响分析,通过 RTO 和 RPO 量化恢复目标
- 应急响应六阶段(准备→检测→遏制→根除→恢复→跟踪总结)为事件处理提供结构化流程
- 灾备等级越高,投入成本呈指数级增长,需根据实际业务需求合理选择
- "3-2-1" 备份原则和两地三中心架构是灾备的成熟实践