拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

浪潮数据AS13000G7拿下MLPerf训练场景双第一:给大模型训练装上“自动存档“

浪潮数据AS13000G7拿下MLPerf训练场景双第一:给大模型训练装上“自动存档“

训练一个大模型,到底有多难?

想象几千甚至上万张GPU卡,要连续跑上几周、甚至几个月,才能完成一轮大模型训练。中间任何一次服务器故障、网络中断,都可能让前面的努力全部归零——除非,系统提前"存了档"。

这个"存档"动作,在 AI 领域叫Checkpoint(检查点)。它每隔一段时间,就把训练进度完整保存下来。一旦出问题,不用从头再来,从最近一次存档点接着跑就行。

听起来很简单?难就难在:这个"存档"极其频繁、数据量极大,而且训练越大的模型越考验存储的速度。存得太慢,几千张 GPU 就得停下来干等——每一秒等待,都是真金白银的算力浪费。

这就是今天要讲的故事:浪潮数据如何解决"大模型训练存档慢"这道难题。

01

一张来自国际权威评测的成绩单

近日,国际权威AI基准评测组织MLCommons公布MLPerf® Storage V3.0测试成绩。在大模型训练最核心的 Checkpoint场景(Llama3.1-70B 模型负载)中,浪潮数据AI存储 AS13000G7拿下多项单节点、单U读写带宽双第一:

  • 单节点读带宽269 GiB/s,单U读带宽134 GiB/s

  • 单节点写带宽195 GiB/s,单U写带宽97 GiB/s

浪潮数据在Checkpointing(Llama3.1-70B)

负载下测试成绩

翻译成大白话就是:它一秒钟能读入的数据,相当于200多部高清电影。而MLPerf® Storage之所以被全球智算中心、大模型企业当作选型标尺,正是因为它的考试方式很"刁钻"——要求连续完成10轮循环读写、每轮都是TB级数据灌入,全程不掉速才算合格。靠临时调优刷出来的"一次性高分",在这里行不通。

单节点、单U两个维度同时登顶,对客户意味着两件事:单节点性能越强,集群里需要的存储节点就越少,采购和运维成本越低;单U性能密度越高,越能节省宝贵的机房空间和长期电费——性能和成本,两头都占。

02

高分背后:三个"看不见的功夫"

很多人以为,跑分高就是堆了几块好硬盘。但这次成绩的看点恰恰在于:硬件只是地板,软件架构才决定你能摸到多高的天花板。AS13000G7搭载浪潮数据自研的InData AIOS,靠的是三招"内功"。

第一招:数据不绕路,直接上高速

传统存储架构里,数据写入要先经过一层"中转站"(控制节点)再落盘,路径绕、效率低——就像快递要先送到分拣中心,再发往目的地。

玄同架构把"指挥"和"搬运"彻底分开:指挥系统只管调度,数据本身不再经过中转,直接写入硬盘。路径短了,速度自然就上来了。

玄同架构下数据路径示意图

第二招:一次搬运,连"签收单"一起搞定

存储数据时,系统还要额外记录一份"校验信息"(用来确保数据没写错)。传统做法要分两次操作完成,等于搬一次货、签两次单。

AS13000G7把这套流程合并成一次:数据连同校验信息一次落盘,I/O交互次数减少50%,写延迟被明显压低。别小看这 50%——在每轮TB级数据、连续10轮的高压测试里,省下的每一次往返,都实实在在地转化成了带宽优势。

原生全闪存数据布局技术优化前后对比

第三招:给每块硬盘配个"智能调度员"

一个存储节点里有很多块硬盘。传统方案按固定规则分配数据,容易"旱的旱死、涝的涝死"——有的盘累到打满,有的盘闲到发慌,整体速度被拖垮。

InData AIOS里的智能负载均衡,像一位实时盯着路况的调度员:哪块盘有空闲,数据就往哪走,让每一块硬盘都跑满性能,谁也别闲着。

智能负载均衡功能优化前后对比图

03

跑分之外,客户真正得到什么

榜单上的数字,最终要落回客户的机房里。Checkpoint速度提上来之后,客户得到的是一连串实打实的好处:

  • 训练更稳:存档快,故障恢复就快,长周期训练不再提心吊胆;

  • GPU不空等:数据供得上,昂贵的算力资源每一秒都花在刀刃上;

  • 成本更优:同样的带宽需求,用更少的存储节点就能满足。

大模型训练是一场马拉松,而存储决定的是——你中途停下来"喝水存档"时,需要多久才能重新跑起来。浪潮数据用这套从架构到调度的全栈自研能力,让每一次"存档"都快人一步。

浪潮数据将持续深耕AI存储技术,让算力不等待、让训练不掉速,为千行百业的大模型落地筑牢数据底座。

返回列表