十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

华为Atlas 950 SuperPoD:超节点形态如何解决大模型训练通信瓶颈

华为Atlas 950 SuperPoD:超节点形态如何解决大模型训练通信瓶颈 华为在 WAIC世界人工智能大会现场首次展示 Atlas 950 SuperPoD 服务器这条信息真正值得关注的不是“又多了一台新机器”而是这种产品的形态开始改变团队搭建 AI 训练算力时的工作方式。过去如果要训一个大模型大家习惯按“多少台服务器、多少块加速卡、多大交换机”来选型而 Atlas 950 SuperPoD 这类超节点是把一个大规模算力集群提前做成一个可以整体供电、散热、组网和调度的资源单元。它解决的核心问题是当模型参数动辄百亿、千亿甚至继续往上走单纯把卡数量堆起来并不能等价于训练速度提升。真正决定效率的是计算节点之间能不能以非常低的延迟、非常高的带宽做梯度同步和状态交换。适合看这篇文章的读者主要是在做 AI 基础设施选型、大模型训练平台建设以及帮团队评估“要不要换超节点架构”的工程师和架构师。算法同学也可以看因为你至少要了解模型并行策略和硬件通信之间的匹配关系。下面按“它到底是什么—技术升级在哪里—展台看什么—落地前要准备什么—哪些场景值得上—运维排查顺序”展开。1. 先正确认识 Atlas 950 SuperPoD它不是一台普通服务器而是一个算力单位1.1 通过名字理解产品定位Atlas 950 SuperPoD 这个名字可以拆成三层来读。Atlas 是华为 AI 计算硬件序列代表这个产品归属在统一的 AI 算力产品体系下。950 是产品系列代号说明它在整个产品线里有一个明确的定位区间。SuperPoD 是形态描述。Super 很好理解PoD 不建议直接翻译成“豆荚”它来自数据中心里常用的资源单位概念把多个机架、多台节点看作一个可以在同一个管理边界内统一调度的“资源池”这个资源池能向上层平台提供一个相对完整的计算、通信和存储能力边界。一台普通服务器你拿到的是一个有着固定计算单元数的独立主机之后还要自己规划怎么把多台机器连成集群。Atlas 950 SuperPoD 拿到的更像是一个“算力单元”内部已经完成了比传统分散集群紧密得多的互联和系统化设计。用户更关注的是如何把这个单元接入自己的训练平台并让训练作业在上面稳定运行。一个很容易产生的误解是把 SuperPoD 和大尺寸服务器搞混。实际上超节点通常意味着内部包含多个计算节点、高速交换模块以及整体的供电散热框架。虽然外面看起来可能是较大的机柜或机柜组合但它的本质是一个逻辑上的资源池边界而不是 CPU、内存、卡数全部绑死的一台独立主机。1.2 它要解决的问题大模型训练的“长尾工程”很多同学第一次跑大模型发现本地单台机器可以跑通一个小规模 Demo用的是小模型、小批量、几百条数据。之后把批量加大、序列加长、参数规模涨到几十亿以上立刻发现每轮训练时间长得像静止一样。原因不只是单张卡不够而是分布后引入了大量通信开销。数据并行阶段每张计算卡训练一部分数据每完成一个或几个 step就要把所有卡上的梯度结果汇总并同步给全体让所有卡维持一致的模型参数。这个动作在分布式系统里叫集合通信。卡数越多参数规模越大同步时间越长。如果有几百张卡一起训练一个大模型且网络没有足够吞吐计算资源的等待时间会远远大于真正计算的时间。Atlas 950 SuperPoD 这样的产品形态核心价值是尽可能消除这种瓶颈把高速互联、供电、散热、健康管理一起作为整体设计让训练软件看到一个连接良好且相对可控的大通信域。它解决的不只是“有多少算力”也是“这些算力能被模型训练用得多高效”。1.3 和普通 AI 服务器集群的差异怎么判断落到选型层面可以用几个维度衡量一个新服务器形态是否适合大模型训练。对比维度传统自建 AI 集群SuperPoD 形态定位交付颗粒度用户自己按服务器、交换机采购以预集成超节点为交付单位通信拓扑多台独立服务器通过外部交换机连接内部高速互联拓扑规划更细上架复杂度自己连电源、网络、做系统高集成度交付对外提供统一资源池接口高密度散热单机风冷为主高密度另配液冷机柜级供电散热设计往往需要液冷作业调度可以接已有调度平台需要重点确认与已有调度平台的接入能力故障隔离单机故障相对容易隔离需要关注大资源池内故障域的切分这个表更适合辅助判断。任何设备都要结合自己的机房、存储、框架版本来综合评估不能只盯着宣传页上的总算力。1.4 为什么会先出现在 WAIC 这样的场合WAIC 汇集了很多 AI 研发人员和产业合作方。超节点这种形态在公开大会亮相本质上是要把一个完整的训练算力底座推到前端。比起逐个展示单卡展示一个可以被理解和规划的算力单元能让下游团队更快判断自己是否需要这类基础设施。对观众来说看到的不仅是一台服务器更是未来 AI 基础架构的一种交付思路。2. 从分布式训练到超节点核心升级是“通信”和“资源抽象”2.1 为什么模型越来越大后通信越来越“重”大模型训练的分布式方式并不只有一种。不同并行策略对通信的依赖也不太一样。数据并行时每张卡保存完整的模型参数副本每轮训练后会做梯度同步。这个同步带宽需求跟模型参数量是正相关的。假如模型达到几百 B 参数即使每个参数只占一到两个字节一次全量梯度同步也会产生非常大的数据量。这里不列具体数字覆盖所有场景但是可以想象梯度体积会乘以参与通信的卡数如果通信不高效训练就会变成大量时间在等参数。张量并行时模型会按层内部结构切分到不同卡上。每一层计算会产生中间结果这些中间结果需要发送到相邻计算节点。层数越多、矩阵尺寸越大中间结果的交换量也越可观。流水线并行则把不同层放到不同设备或节点上数据在节点间像流水一样顺序经过。单次通信不一定形成瓶颈但一旦某一个节点变慢整个链路都会被拖住。任何一个节点的延迟抖动都会被放大成整个训练时间的变化。真实的大模型训练常常把这几种并行方式混在一起使用。所以“模型和硬件拓扑怎么匹配”不是一句“多加卡”就能解决。通信模型会越来越复杂SuperPoD 在设计上把卡间同步代价尽量降低给上层算法留出更多余量。2.2 集合通信里的 AllReduce、All-to-All 为什么关键大模型训练里有几类标准通信操作非常重要。AllReduce多张卡之间完成数据聚合再把结果广播给所有卡。数据并行训练时的梯度同步主要依赖它。All-to-All每张卡都要向组内其它卡发送数据也会接收来自其它卡的数据。典型场景是 MoE混合专家模型。MoE 模型把网络拆成很多专家子网络输入 token 会根据路由策略被分到不同专家上如果专家分布在不同节点数据就会发生大量节点间搬迁。专家越多、token 量越大All-to-All 的通信开销越明显。Broadcast 和 Reduce多用于主节点下发模型参数、汇总局部结果。理解这些通信原语
返回列表