简介:这份《FusionSphere虚拟化套件技术白皮书》面向云计算运维工程师、虚拟化架构师及IaaS平台学习者,系统讲解华为FusionSphere解决方案的技术原理与落地思路。文档从敏捷IT理念切入,阐述虚拟化、标准化、自动化三大核心衡量标准,并围绕FusionCompute、UltraVR、eBackup等组件展开产品组合介绍,涵盖计算虚拟化、存储虚拟化、网络虚拟化、资源池化、自动化运维及跨站点容灾等关键技术领域。资源包内含1个PDF文件,大小约1.07MB,结构完整,包含摘要、产品概述、标准化原子能力、自动化能力、关键技术、开放性与安全可靠、总结及缩略语表等章节,便于按模块查阅。目前已有82人学习。读者可借此理解FusionSphere如何将基础设施抽象为标准化业务部件并自动化组合,掌握开放性、安全可靠性的实现方式,为云平台选型、部署规划与业务诉求匹配提供参考。
1. 拿到这份 FusionSphere 6.5.0 白皮书,先搞清楚它能帮你回答什么
如果你正在做华为虚拟化平台的选型、交付或者运维,手头大概率会缺一份能把“虚拟化、标准化、自动化”三条线串起来的底层说明。FusionSphere 6.5.0 技术白皮书就是干这个的——它不是操作手册,也不是安装指南,而是一份把 FusionCompute、UltraVR、eBackup 这几个核心部件的设计逻辑、原子能力边界和关键技术选型讲透的架构文档。适合谁看?正在评估华为虚拟化方案能不能扛住生产负载的架构师,准备做容灾和备份方案落地的交付工程师,以及需要跟客户解释“为什么选这套而不是那套”的售前。它解决的不是“点哪个按钮”,而是“这套平台的能力从哪来、边界在哪、什么场景该用哪个部件”。
2. 产品组合拆解:FusionCompute、UltraVR、eBackup 各管哪一段
2.1 三个核心部件的职责边界
白皮书里把 FusionSphere 的产品组合拆得很清楚,但第一次看容易把三个部件的关系搞混。我按实际交付场景重新捋一遍:
FusionCompute 是整个方案的底座,负责把 x86 物理服务器、SAN 设备做虚拟化,同时提供软件定义网络的基础能力。你日常打交道最多的就是它——创建虚拟机、挂载虚拟存储、配 VLAN 网络平面,全在这个部件里完成。UltraVR 是跨站点容灾部件,它不直接管计算资源,而是配合华为存储的远程复制功能,把生产站点的虚拟机数据复制到容灾站点,同时管理 VM 的恢复计划。eBackup 则是备份部件,利用 FusionCompute 的快照能力做无代理备份,支持在线备份和多种生产存储类型。
这三个部件的分工可以用一句话概括:FusionCompute 管“跑起来”,UltraVR 管“挂了能切”,eBackup 管“丢了能找回来”。实际部署时,FusionCompute 是必选,UltraVR 和 eBackup 按业务连续性要求选配。
2.2 从技术地图看标准化原子能力的组织方式
白皮书里那张技术地图值得单独拿出来说。它从“虚拟化、开放、标准化、自动化”四个维度组织所有技术点,每个部件对应哪些能力一目了然。比如 FusionCompute 在虚拟化维度覆盖计算虚拟化、存储虚拟化、网络虚拟化、集群技术;在标准化维度输出通用 x86 服务器、虚拟存储、虚拟网络平面、虚拟网关、虚拟负载均衡这些标准构件;在自动化维度提供标准构件自动发放和构件服务质量保障。
这张图的价值在于:当你需要跟客户解释“为什么 FusionSphere 能像搭积木一样构建系统”时,直接指着这张图说——每个构件形态稳定、易于替换、可回收重用,这就是标准化的意义。实际做方案设计时,我也是按这张图的维度来梳理需求:先看业务需要哪些原子能力,再看这些能力由哪个部件提供,最后确认自动化管理能不能覆盖发放和回收的全生命周期。
2.3 虚拟机、虚拟存储、虚拟网络三个原子能力的实操要点
白皮书第 3 章对这三个原子能力的描述偏概念,我补充一些实际配置时需要注意的参数和操作逻辑。
虚拟机这块,FusionCompute 支持将 x86 服务器虚拟化为多台虚拟机,最终用户拿到的体验跟物理服务器基本一致——装系统、挂磁盘、调网络都行。但有个细节:虚拟机的硬件配置是系列化的,驱动程序统一,这意味着你没法像物理机那样混插不同型号的网卡或 RAID 卡。做兼容性规划时,要提前确认业务系统对硬件特征的依赖。
虚拟存储的核心价值在于“虚拟卷不一对一映射到具体磁盘”。FusionCompute 支持将 SAN 设备、计算节点本地存储、FusionStorage 提供的虚拟存储空间统一管理,以虚拟卷形式分配给虚拟机。实际配置时,瘦分配、QoS 限制、快照、迁移这几个特性需要根据业务类型组合使用。比如数据库类业务建议开 QoS 限制防止 IO 争抢,测试环境可以用瘦分配节省空间。
虚拟网络这块,分布式虚拟交换机的行为逻辑需要重点理解:同一宿主机上不同 VLAN 的虚拟机不能直接互通;同 VLAN 的虚拟机通过内存交换,不受网络带宽限制;跨宿主机的同 VLAN 虚拟机通过外部交换机互通。做网络规划时,VLAN 划分直接决定了业务隔离的粒度。另外管理网络平面和业务网络平面都支持 IPv4 和 IPv6,双栈环境部署时不用额外折腾。
3. 自动化能力落地:HA、DRS、QoS 到底怎么配
3.1 虚拟机 HA 的触发条件与恢复边界
虚拟机 HA 是 FusionSphere 自动化能力里最常用的一个。它的逻辑是:系统周期检测虚拟机状态,当物理服务器宕机等引起虚拟机故障时,自动将虚拟机迁移到其他物理服务器重新启动。目前能检测到的故障原因包括物理硬件故障和系统软件故障。
但这里有个血泪经验:HA 重启的虚拟机像物理机一样重新引导,加载操作系统,所以故障发生时没有保存到硬盘上的内容会丢失。这意味着 HA 解决的是“虚拟机能不能重新跑起来”,不解决“数据丢不丢”。对数据一致性要求高的业务,HA 必须配合应用层的高可用机制一起用。
配置层面,HA 是在集群的高级设置里启用的。启用后,创建虚拟机时可以选择是否支持故障重启。注意:对于未启用 HA 功能的虚拟机,发生故障后会处于停机状态,需要人工介入启动。所以批量创建虚拟机时,建议按业务重要性分组,核心业务全部开 HA,边缘业务按需开启。
3.2 DRS 动态资源调度的阈值设置与生效逻辑
DRS 解决的是集群内资源不均衡的问题。它的策略针对集群设置,可以配置调度阈值和策略生效的时间段。在生效时间段内,如果某主机的 CPU 或内存负载超过阈值,系统自动迁移一部分虚拟机到负载低的主机。
实际配置时,阈值设置是个玄学。设太低,频繁迁移导致不必要的开销;设太高,资源不均衡影响业务体验。我一般会先观察业务负载曲线,把阈值设在日常峰值上方 10% 到 15% 的位置。另外策略生效时间段要避开业务高峰,比如设成凌晨低峰期执行迁移,减少对在线业务的影响。
DRS 还支持亲和性规则——可以定义哪些虚拟机必须在同一主机上运行,哪些必须分开。这个在做数据库主备或者授权绑定硬件的场景下很有用。
3.3 CPU QoS 和内存 QoS 的参数含义与配置建议
QoS 是保证虚拟机计算能力可衡量的关键机制。CPU QoS 主要体现在计算能力的最低保障和资源分配的优先级。创建虚拟机时,根据业务对 CPU 性能的要求指定相应的 QoS 等级。不同的 QoS 等级代表不同的计算能力,系统会按等级保障最低算力和分配优先级。
内存 QoS 依赖内存预留比。系统通过内存气泡等复用技术,将物理内存虚拟出更多虚拟内存供虚拟机使用。每个虚拟机都能完全使用分配的虚拟内存,但运行时至少能获取到预留大小的内存。这个机制的核心原则是优先使用物理内存。
配置建议:核心业务虚拟机设置较高的内存预留比,保证任何情况下都有足够物理内存可用;测试和开发环境可以设低预留比,提高资源利用率。CPU QoS 同理,生产库和关键应用给高优先级,内部工具类虚拟机给低优先级。
3.4 备份策略的自动化配置与保留周期管理
eBackup 的自动化备份通过备份策略实现。白皮书里提到最多支持 200 个备份策略,支持对全备份、增量备份、差量备份分别设置不同的备份周期和时间窗口。比如可以配成每周一次全备、每天一次增备,也可以只做一次全备后续一直增备。
实际配置时,备份数据保留时间要跟存储容量一起算。保留时间越长,需要的备份存储空间越大。我一般会按业务的数据变化率和恢复点目标来定:变化快的业务保留 7 到 14 天,变化慢的保留 30 天。另外备份策略优先级也要设,避免多个策略同时执行导致备份窗口争抢。
eBackup 支持备份到多种存储,包括备份服务器所在虚拟机挂载的虚拟磁盘,以及外接的 NFS/CIFS 共享文件系统。做方案设计时,备份存储的容量和性能要单独规划,不要跟生产存储混在一起。
4. 关键技术底层的选型逻辑:UVP、存储虚拟化、分布式虚拟交换
4.1 UVP 裸金属架构的计算虚拟化实现
FusionSphere 的计算虚拟化基于 UVP 平台。UVP 是介于硬件和操作系统之间的软件层,采用裸金属架构的 x86 虚拟化技术,基于开源 KVM 技术增强。它的核心工作是把 CPU、内存、I/O 等物理资源转化为可统一管理、调度和分配的逻辑资源,在单个物理服务器上构建多个同时运行、相互隔离的虚拟机执行环境。
裸金属架构的好处是性能损耗小、可用性和安全性高。UVP 支持热迁移、DRS 等高可用特性,广泛用于服务器整合、虚拟桌面、科学计算、Web 应用等场景。实际选型时,如果你的业务对虚拟化性能敏感,比如高频交易或者实时数据处理,UVP 的裸金属架构比宿主型虚拟化方案更有优势。
4.2 存储虚拟化的统一抽象与数据存储扩容
FusionSphere 的存储虚拟化基于主机实现,用户不需要关注存储设备的类型和能力。它支持 IPSAN、FCSAN、NAS、本地磁盘,以文件系统进行屏蔽,统一提供文件级别的业务操作。提供的功能包括精简置备磁盘、增量快照、存储冷热迁移、链接克隆虚拟机、虚拟机磁盘扩容等。
数据存储扩容特性值得单独说:一个数据存储可以管理多个物理 LUN 空间,实现对数据存储灵活地进行空间扩容。这个在做容量规划时很有用——不用一开始就买够存储,可以按业务增长逐步扩容。但要注意,扩容操作虽然灵活,但底层 LUN 的性能和可靠性差异会直接影响数据存储的整体表现,规划时要把同类型的 LUN 放在一起。
4.3 分布式虚拟交换机的转发性能与安全能力
分布式虚拟交换机在服务器的 CPU 中实现完整的虚拟交换功能。虚拟机的虚拟网卡对应虚拟交换的一个虚拟端口,服务器的物理网卡作为 UplinkPort。它的性能特点很明确:同一服务器上的虚拟机间报文转发走内存交换,不出服务器,转发路径短,性能高;跨服务器通信需要经物理交换机转发,性能稍低于物理交换机实现虚拟交换。
扩展灵活性是软件实现的最大优势——相比采用 L3 芯片的物理交换机,功能扩展灵活快速,可以更好地满足云计算的网络需求扩展。规格容量方面,服务器内存大,L2 交换容量和 ACL 容量远大于物理交换机。
安全能力上,虚拟交换机提供防止虚拟机 IP 地址仿冒的功能。另外 FusionSphere 支持 SRIOV 网卡提供虚拟交换能力,对性能要求极高的场景可以用这个方案绕过软件交换的开销。
4.4 备份与容灾方案的选型对照
白皮书里给出了备份和容灾的方案选择建议,我整理成对照表方便决策:
| 场景 | 推荐方案 | 关键指标 |
|---|---|---|
| 常规虚拟机备份 | eBackup 虚拟机备份 | 无代理、在线备份、最多 200 个策略 |
| 需要用户级历史数据恢复或归档 | 用户数据备份到第三方备份服务器 | 传统备份方式,适合有归档需求的场景 |
| 跨站点容灾 | UltraVR 基于存储远程复制 | RPO 为阵列间复制周期,RTO 典型配置 3000VM < 4 小时 |
| 要求 RPO=0、灾难自动恢复 | 城域双活容灾方案 | 跨站点共享存储,RTO 要求高 |
| 虚拟机与物理机混合容灾 | 基于虚拟机的应用容灾方案 | 应用层容灾,覆盖混合场景 |
UltraVR 的容灾能力还包括集中式恢复计划、自动执行故障切换、无中断测试、计划内迁移。其中无中断测试用存储快照执行恢复测试,不会丢失复制的数据,测试完成后自动清理环境。这个功能在做容灾演练时很实用,不用真把生产站点切过去。
5. 避坑与排查:部署 FusionSphere 时最容易翻车的五个点
5.1 HA 启用了但虚拟机没重启
现象:物理服务器宕机后,该主机上的虚拟机没有自动迁移到其他主机重启。
原因:HA 功能是在集群级别启用的,但虚拟机创建时如果没有勾选“支持故障重启”,这台虚拟机就不会参与 HA。另外如果集群内没有足够的冗余资源,HA 也迁不过去。
解决:批量检查虚拟机的 HA 配置,核心业务全部勾选。同时确认集群内每台主机的资源预留足够承接故障切换后的负载,一般建议预留 20% 到 30% 的余量。
5.2 DRS 频繁迁移导致业务抖动
现象:业务高峰期虚拟机频繁在主机间迁移,应用出现短暂卡顿。
原因:DRS 阈值设得太低,或者策略生效时间段覆盖了业务高峰。系统对负载波动过于敏感,触发了不必要的迁移。
解决:调高调度阈值,把策略生效时间段改到业务低峰期。同时检查是否有虚拟机没有设置亲和性规则,导致 DRS 把它们当成了可随意迁移的对象。
5.3 虚拟存储扩容后性能下降
现象:数据存储扩容后,虚拟机磁盘 IO 性能明显下降。
原因:扩容时把不同性能等级的 LUN 混在同一个数据存储里,慢速 LUN 拖累了整体表现。或者扩容后没有重新平衡存储负载。
解决:规划时把同类型、同性能的 LUN 放在同一个数据存储。扩容后观察存储负载分布,必要时做存储冷热迁移把热点数据迁到高性能 LUN 上。
5.4 备份策略执行超时或失败
现象:eBackup 备份任务在备份窗口内没有完成,或者直接失败。
原因:备份策略太多导致并发争抢资源,或者备份存储的写入性能不足。另外如果虚拟机磁盘变化率高,增量备份的数据量也可能超出预期。
解决:调整备份策略优先级,错开执行时间。检查备份存储的 IO 能力,必要时升级备份存储或增加备份窗口时长。对变化率高的虚拟机,考虑缩短全备周期。
5.5 容灾切换后虚拟机网络不通
现象:UltraVR 执行容灾切换后,虚拟机启动正常但网络不通。
原因:容灾站点的网络映射配置跟生产站点不一致,虚拟机的 VLAN 或端口组在容灾站点没有对应配置。
解决:在恢复计划里提前做好虚拟机到容灾站点资源的映射,包括集群、存储和网络。容灾演练时重点验证网络连通性,不要只验证虚拟机能不能启动。
6. 从白皮书到落地:用恢复计划做一次无中断容灾演练
UltraVR 的无中断测试是我用得最多的功能。它的逻辑是:用存储快照执行恢复测试,不会丢失复制的数据,测试完成后自动清理测试环境。这意味着你可以在不影响生产业务的前提下,定期验证容灾方案的有效性。
具体操作流程是这样的:先在 UltraVR 里创建恢复计划,自动发现并显示受阵列保护的虚拟机,把虚拟机映射到故障切换站点上的相应资源。然后启动恢复测试,系统自动执行恢复流程,用快照数据在容灾站点启动虚拟机。测试完成后查看和导出测试结果,确认无误后执行清理。
这里有个关键细节:恢复测试用的是快照数据,所以容灾站点的虚拟机状态是测试开始那个时间点的。如果生产站点在测试期间有数据写入,这些增量不会体现在测试环境里。所以做演练时,要记录测试时间点,跟生产站点的数据变化做对照。
另一个容易忽略的点是计划内迁移。UltraVR 支持自动执行计划内迁移,正常关闭原始站点上受保护的虚拟机,启动迁移过程前确保在应用保持一致的状态下完整复制虚拟机数据。执行数据同步强制将关闭的虚拟机完整复制到故障切换站点。这个流程适合做数据中心搬迁或者计划内维护,跟故障切换的流程不一样,不要混用。
从那以后我每次做容灾方案交付,都强制走一遍无中断测试流程,把恢复计划里的网络映射和存储映射逐项核对。测试结果导出存档,作为交付验收的依据。希望帮到你。
本文还有配套的精品资源,点击获取