十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

HP MSA 2050磁盘阵列配置实战:从初始化到多路径映射全指南

HP MSA 2050磁盘阵列配置实战:从初始化到多路径映射全指南 上周帮朋友收拾一台二手的HP MSA 2050磁盘阵列设备本身通电自检一切正常可到了配置环节他翻遍电脑里所有资料只找到一张模糊的架构图。这种中端存储的逻辑其实不复杂HP MSA 2050的配置步骤归纳起来就是三件事让控制器能被管理、把硬盘组织成空间、把空间交给服务器。但偏偏这三件事里每一步都有坑尤其是第一次独立做存储初始化的人可能在一个不起眼的小选项上卡住一整天。这篇就把我从拆箱到上线的完整过程写出来包括踩过的坑、排查的思路、以及后来沉淀下来的运维习惯给正要接手MSA 2050的同行参考。1. 上架之前的硬件盘点和规划比配置本身更费时间很多人拿到设备就急着通电想快点看到图形界面。但我在MSA 2050上吃过亏后置接口没提前确认清楚网线插到扩展口上折腾了半天管理IP都ping不通最后发现是插错了口。所以第一步别急着开机先把硬件构成看明白。1.1 机型区别和后背板接口识别MSA 2050有SFF和LFF两种常见形态SFF是2.5寸小盘通常2U能做到24个盘位适合用10K/15K SAS盘做数据库这类性能场景LFF是3.5寸大盘常见12盘位适合大容量SATA/NL-SAS做备份和文件存储。收到设备后瞄一眼前面板盘托规格就知道是哪款。背面是重点两个控制器模块分别标记为Controller A和Controller B每个控制器通常自带4个SFP光纤口型号不同可能用于FC或10Gb iSCSI、4个1GbE业务电口、1个专用管理电口、mini-USB串口以及用于接扩展柜的SAS口。我第一次配置时把笔记本网线接在了控制器的1GbE业务口上想着总能通结果默认管理IP不在业务口上自然连不上去。注意MSA 2050的出厂管理地址走的是独立管理网口不是业务数据口。管理口上有明显标识如果看不清就顺着线找控制器模块上丝印文字别靠猜。1.2 双控制器的角色和盘位归属逻辑双控制器是Active/Active工作模式两个控制器同时处理数据但对前端业务端口来说每个控制器有自己独立的接口。创建虚拟池时如果只把一个控制器的链路接到交换机上一旦该控制器重启或固件升级那台上的业务就会中断。另外有个容易懵的点硬盘槽位不是按“左边给A控制器右边给B控制器”这样物理切分的而是通过SAS背板互联两个控制器都能访问所有盘。你在SMU里看到的磁盘状态是全局视角不区分前后端归属。真正要区分的是前端主机链路和控制器之间的对应关系多路径管理时才会显式体现。1.3 上架前的地址规划清单强烈建议先把一张表格做出来再动手项目规划内容说明管理IP段例如192.168.10.10 / 192.168.10.11两个控制器各一个和业务段隔离业务IP段例如192.168.20.0/24iSCSI主机通信网段交换机端口记录交换机端口号与控制器端口对应关系后面定位物理链路全靠它服务器HBA WWN每台服务器每块HBA卡的WWN记录下来映射卷时必须用卷命名规范如VOL_DB01_DATA_200G避免以后出现“新建卷(2)”这种命名这些信息写在一张纸上贴到机柜门内侧也行写到Excel维护也行。反正别只存在个人电脑里设备交接时太容易丢。2. 初始化过程里三个最容易翻车的细节通电之后两个控制器的管理口各自有默认IP通常是控制器A为192.168.0.1控制器B为192.168.0.2。先用网线把笔记本和管理口直连手动把电脑网卡设成192.168.0.x网段然后浏览器访问https://192.168.0.1。没有默认密码的情况下大概率会先让你设置管理员密码如果设备是二手或以前被人初始化过密码就得找原负责人要或者按设备上的标签找初始凭据。2.1 浏览器和证书问题MSA 2050的SMU管理界面走HTTPS用的是自签名证书。我第一次配置时用的Chrome直接拦了页面还提示“不安全”不少人在这里就以为设备有问题。解决办法很简单从拦截图里的“高级”选项里选“继续前往”或者换Edge/IE兼容模式因为添加受信任证书这步没必要在生产环境折腾。2.2 登录后先检查控制器状态和微码版本登录SMU后先不要急着建池我习惯先看一眼System页面里的控制器状态。正常情况下应该是两个控制器都在线、角色为Active没有Degraded字样。如果其中一块控制器显示离线或需要更换先把这问题解决掉再往下走否则后面建池、映射、多路径全都可能有诡异故障。微码版本也值得核对。两个控制器的固件版本必须完全一致不一致时SMU通常会报警告。真遇到版本不一致从HPE官网下载对应版本的固件包然后在SMU的Firmware Upgrade页面逐个控制器升级。升级过程中不要断电、不要拔网线这属于存储运维的最基本规矩了。2.3 管理界面里磁盘状态“看不顺眼”怎么办全新设备插满盘后SMU的磁盘页面里可能会显示一堆Uninitialized或者其他状态有些盘甚至显示Not Available。这时候别急先把盘复位很多情况下重新插拔无效需要在SMU里把对应磁盘置成Ready。MSA 2050的界面逻辑是磁盘要么在虚拟池里要么是可用空闲盘新建虚拟池时从Free Pool里选择即可。还有一点容易忽略SAS盘和SATA盘不要混在同一个虚拟池里。不是完全不能共存而是两者性能和特性差异太大混插只会让整体表现按照慢的那种走排查问题也更麻烦。如果机器里混着SAS和SATA先把盘按类型分开再规划成两个池。3. 创建虚拟池RAID级别和热备盘要按场景选而不是按习惯选虚拟池Virtual Pool是MSA的底层空间池卷Volume从池里划分出来映射给主机。打个比方虚拟池是仓库卷是仓库里的独立房间主机是拿到房间钥匙的人。如果仓库地基没打牢——RAID级别选错或者热备留太少——后面想改就麻烦了。3.1 RAID级别选型决策表MSA 2050支持RAID 0、1、5、6、10部分固件还支持ADM高级数据镜像相当于跨池的RAID 1。很多人一上来就问“哪个RAID最好”没有最好的只有最合适的使用场景推荐级别原因核心数据库OLTP日志盘RAID 10随机读写下限高坏盘重建速度快最稳文件共享、虚拟机镜像、视频流RAID 5空间利用率高顺序读写友好一块盘冗余够用大容量备份池、冷数据归档RAID 6大容量盘重建时间长两块盘冗余更让人放心跨池镜像保护关键数据ADM相当于存储级双写适合最核心的那部分卷如果当前业务对容量要求不高我更倾向于RAID 10。原因很简单RAID 5在单块大容量盘故障后的重建过程对后端IO压力很大重建期间如果再来一块盘故障数据直接就没了。RAID 6给双盘冗余但写性能有损耗而且重建仍然慢。RAID 10用一半容量换来的故障容忍度在小规模场景下非常值。3.2 热备盘到底要不要单独配建议配尤其盘数少的时候。12块盘跑RAID 10配1块热备实际可用容量按11块盘的一半来算。热备盘平时不参与业务等某块盘故障时自动顶替这样可以缩短人工干预时间。但也不能把热备当万能到了保修期边缘、或手头备件充足时热备就只是个保险。多年维护下来我的经验是热备盘故障率其实和普通盘一样别指望它能100%兜底定期看SMU里的热备状态也很有必要。3.3 容量计算和真实操作步骤假设手头是12块1.2TB 10K SAS盘全部做成RAID 10可用容量 (12/2) × 1.2TB ≈ 7.2TB留1块热备则按11块算 ≈ 6.6TB全部做成RAID 6可用容量 (12-2) × 1.2TB ≈ 12TB再留1块热备就按11块算 ≈ 10.8TB拆成两个池一个RAID 10放数据库一个RAID 6放备份文件这样性能和数据冗余各自满足互不干扰SMU里创建虚拟池的路径是Storage → Virtual Pools → Create。按向导选择磁盘、RAID级别、热备策略后确认名称和描述。注意命名一定别随意后续卷的归属全靠池名称区分。这里有一个我踩过的实际教训第一次建池时贪方便把24块盘的整台设备做成了一个RAID 5大池当时觉得“一块盘冗余够了空间最大化”。结果某天两块盘同时亮故障灯虽然最后数据靠重构救回来了但整个过程心惊肉跳。后来所有生产相关设备我默认RAID 10起步。3.4 ADM模式的使用边界MSA 2050支持ADM可以跨虚拟池做镜像。实际项目中我只在一种情况下强烈推荐它现场只有一台MSA 2050又必须给最关键的业务卷提供更高的数据安全性。比如一个池用性能好的SAS盘另一个池用便宜的SATA盘做ADM后双份数据都有。代价是容量占用翻倍而且两个池的性能上限由较差的池决定。预算允许时ADM可以作为“单机存储里的双保险”但不能替代真正的灾备。4. 创建卷并完成主机映射这块新磁盘到底该怎么“递”给服务器虚拟池建好后服务器那边还看不到任何空间必须经过“创建卷”和“映射主机”两个动作。很多第一次配置的人在这里卡壳反复在系统里重扫磁盘也找不到盘原因就是映射步骤没做对。4.1 创建卷的容量规划与格式卷的创建入口在Storage → Volumes命名规则建议包含用途和容量例如VOL_DB01_DATA_500G。容量按需分配注意MSA通常支持精简配置Thin Provision和厚配置Thick Provision。数据库和核心应用建议用厚配置空间提前锁定性能更稳定测试环境或桌面虚拟化可以用精简配置实际写多少占多少避免“买了不用”的空间浪费。创建卷时还会让你选择所属虚拟池千万别随手选一个。我曾见过把数据库卷放到备份池里的案例结果备份任务一跑存储整体延迟就飙上去。不同性能级别的池一定要“物尽其用”。4.2 主机注册拿到WWN或IQN是映射的前提映射卷之前必须先把服务器定义成一个“主机”。存储设备不认识服务器的IP或者主机名它只认光纤卡的WWNWorld Wide Name或者iSCSI发起程序的IQN。获取方式各系统不太一样系统/连接方式查看方法Windows FC HBAHBA卡厂商管理工具如QLogic/Emulex里查看WWNWindows iSCSI控制面板 → iSCSI发起程序 → 配置 → 发起程序名称Linux FCcat /sys/class/fc_host/host*/port_nameLinux iSCSIcat /etc/iscsi/initiatorname.iscsi把每个主机需要的WWN/IQN整理成列表再进SMU的Hosts页面创建主机主机类型按操作系统选比如Windows Server 2022就选对应的Windows版本选项Linux选对应的分发版本。如果一台服务器有多块HBA卡比如双卡做冗余那就把两个WWN都加到同一个主机条目里。4.3 映射的两种入口和集群共享卷映射路径有两条从Volumes页面选中卷点“Map to Host”选目标主机也可以从Hosts页面选中某台主机给它分配卷。两种入口本质一样按自己的操作习惯来就好。如果多台服务器要做文件共享读写同一块LUN比如Windows故障转移集群存储那头要把这些服务器放进同一个主机组Host Group然后把卷映射给整个主机组。否则一台服务器映射后其他服务器看不到集群创建时会非常被动。建主机组这一步别偷懒加上组名后以后增减成员和重启服务都方便不少。4.4 多路径配置不配MPIO/多路径存储性能会白白损失一半双控制器存储最怕的不是“一根线连到A控制器”而是“一根线连到A控制器另一根到B控制器但服务器端没装多路径软件”。这种情况下两条路径同时可见同一块盘操作系统会认为是两块盘数据写入时可能产生竞争甚至I/O错误。Windows上需要安装MPIO功能然后在“MPIO”管理界面里选中“Add support for iSCSI/FC设备”让系统知道这块盘需要做负载均衡和故障切换Linux上则配置multipath把同一个卷的多个路径合并成一个dm设备。MSA 2050支持ALUA配置完成后系统能感知到“当前最优路径”和“备用路径”正常情况下IO走A控制器A控制器故障时自动切到B控制器。多路径配置完在系统里应该看到的是一个盘符/一个多路径设备而不是一堆重复磁盘。如果看到重复盘先检查路径合并有没有生效再检查主机定义里是不是把同一个WWN加了两次。这个问题我在一台Windows Server上遇到过表现是存储识别为多块未初始化的盘差点手一抖把盘给格式化了。遇到类似情况一定先在存储侧把映射关系理清再动系统侧的磁盘操作。4.5 上线前的验证动作映射完成后在服务器端重扫磁盘。Windows下在“磁盘管理”里右键选“重新扫描磁盘”Linux下执行echo 1 /sys/class/scsi_device/xxx/device/rescan不熟悉命令的直接重启一次系统反而最省事。确认能看到符合预期容量的新磁盘然后才能进行分区、格式化和业务上线。5. 上线后真正检验配置水平的是排障和维护习惯存储上线只是开始。我见过太多设备配置完成后就扔在那不管直到某天业务系统挂了才发现控制器早就离线。运维习惯直接决定这套设备能稳定跑多久。5.1 服务器看不到盘的排查链路如果映射完服务器端死活不认盘按这个顺序查基本20分钟内能定位物理链路状态光纤口/网口指示灯是否正常交换机端端口是否up有没有松动存储侧映射状态SMU里确认卷和主机的映射关系还在主机条目的WWN/IQN是否确实对应这台服务器SAN交换机Zoning如果是FC组网确认服务器和存储端口在同一个Zone里Zoning没做的话WWN再多也白搭多路径状态确认多路径服务已启动multipath -ll能看到设备而不是一堆sd盘系统重扫执行系统重新扫描已经是最常见的最后一步多数时候都是前面几步有遗漏这五步的优先级按“物理层 → 存储逻辑层 → 网络层 → 系统层”来排从底往上查不会漏。5.2 性能不达预期的常见原因存储慢的时候先别急着换硬盘。排查顺序通常是前端主机链路是否只有单路径故障切换是否生效虚拟池是否混插了SAS和SATA或者机械盘和SSD放在同一个池里RAID级别是否不适合IO模型比如把小文件随机读写的数据库卷放到了RAID 6上两个控制器的业务负载是否严重不均某些卷只走一个控制器后端扩展柜的级联口带宽是否有瓶颈MSA 2050的SMU里能看到每个虚拟池的IOPS和带宽先看有没有单池负载过高的现象再逐层分析。大多数“存储很慢”的工单最终都指向了规划问题而不是硬件故障。5.3 告警、通知和快照的日常使用建议SMU里把邮件告警配好非常有必要。设置菜单里填上邮件服务器地址、发件人、收件人邮箱让系统在磁盘故障、控制器离线、电池异常时主动发出通知。没配邮件告警的存储就像没装烟雾报警器的机房等发现时往往已经晚了。快照和本地复制功能建议提前了解。MSA 2050支持对卷做快照和克隆但部分功能依赖许可。日常维护里至少有“变更前手动做一次快照”的意识比如固件升级、大版本补丁这类操作前花两分钟做个快照万一出了状况还能快速恢复。这里的成本很低价值却非常高。5.4 配置文档和标签是留给未来同事最好的礼物每次配置完把当前的虚拟池、卷、主机、映射关系、管理IP、业务IP全部导出一份文档。SMU界面里很多页面可以通过右键或浏览器开发者模式抓到接口返回的数据手工整理也不难。然后打印一份简短的拓扑图和设备贴在同一张纸上。别高估记忆力也别高估下一任维护者的耐心。我这些年接手过的存储里配置齐全、标签清晰的那几台维护效率不知道高到哪去了。我对MSA 2050的整体评价是功能不花哨但稳定可靠尤其适合中小规模环境。只要初始化阶段把RAID策略、热备、多路径和告警这几件事做扎实往后的运维会轻松非常多。如果这篇文章能帮你少走哪怕一小段弯路我就觉得没白写。
返回列表