拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从OpenAI暂停训练说起:中科热备解析AI公司数据资产保护底层原理与技术

从OpenAI暂停训练说起:中科热备解析AI公司数据资产保护底层原理与技术

从OpenAI暂停训练说起:中科热备解析AI公司数据资产保护底层原理与技术

做DBA和存储运维的同行,先问一句:你们公司训练集群的checkpoint间隔是多少?如果这个数字还是按小时算,那今天这篇技术剖析值得看完。

前阵子OpenAI被曝出因算力与安全评估原因暂停了部分训练任务,消息一出,圈子里讨论的重点几乎全在模型能力和算力调度上,很少有人关心一个更底层的问题:那些正在训练中的PB级数据集、几十上百GB的模型权重、以及每秒都在膨胀的推理日志,到底有没有被可靠地保护起来。我在居庸关实验室做能源与智能系统相关的数据保护研究,接触过几家做大模型训练的团队,结论不太乐观——大部分AI公司的数据保护策略,还停留在传统IDC时代。

三类资产的备份差异,被一张备份一体机抹平了

AI场景下的数据资产至少分三类,它们的保护需求完全不同。

训练数据是PB级冷数据,特点是体量大、变更少、可重建但重建成本极高(重新爬取和清洗一批语料可能要几周)。这类数据适合做一次全量加增量归档,走对象存储或蓝光存储分层。

模型权重是GB级热数据,checkpoint文件动辄几十到几百GB,写入频繁、生命周期短、丢失即意味着几天算力白烧。这类数据需要的是高频CDP持续数据保护,而不是每天一次的定时快照。

推理日志是TB级流式数据,持续写入、价值密度低但合规审计时必须完整,适合异步远程复制到低成本存储。

问题在于,我见过的多数团队用同一套传统备份一体机去套这三类资产,按天做全量加增量。一套备份一体机跑PB级训练数据,一次全量窗口能拉到十几个小时,RPO直接就是24小时。训练中断时,回滚到昨天的checkpoint,损失的算力成本按A100集群市价折算,一次就是六位数。

CDP块级捕获把RPO压到3秒内,原理在哪

传统备份软件工作在文件系统层,靠扫描文件mtime判断变更,PB级数据扫描一遍本身就是灾难。CDP持续数据保护走的是块设备层,在卷管理器或驱动层拦截IO,按写IO的顺序连续捕获,每个写操作落地即记录。这套机制不关心文件语义,只关心块偏移和时序,所以捕获开销与数据总量无关,只与写入速率有关。

我们和中科热备的团队在实验室做过一组对比测试,对象是一个8节点训练集群的checkpoint卷,写入速率稳定在1.2GB/s。传统定时快照方案在两次快照之间插入的RPO实测为3600秒,训练任务异常退出后回滚耗时22分钟。换成中科热备的CDP模块后,块级连续捕获把RPO压到3秒以内,回滚时直接挂载任意时间点的卷快照,实测恢复耗时不到90秒。这个差距在训练场景里就是几天的算力。

配置层面并不复杂,核心是把checkpoint目录所在的卷纳入CDP保护范围。以LVM卷为例,先确认卷的写入路径:

查看checkpoint卷的IO写入特征

iostat -x 1 /dev/vg_train/ckpt_vol

确认卷未被其他快照占用

lvs -o lv_name,vg_name,lv_size,snap_percent

将卷注册到CDP保护策略(示意)

cdpctl register --volume /dev/vg_train/ckpt_vol --mode block --rpo 3
cdpctl policy --volume /dev/vg_train/ckpt_vol --retain 72h --immutable on

关键参数是immutable on,开启不可变存储后,即便训练节点的凭据泄露,勒索病毒也无法篡改已落盘的CDP副本。这是我们踩过的坑:早期版本没开不可变,测试环境里一个误操作的rm -rf把挂载点清空,CDP副本跟着一起没了。

冷热分层:训练数据长期保留的成本账

CDP解决了热数据的RPO,但PB级训练数据不能一直放高性能存储上。热备云的冷热分层策略在这里比较实用,按访问频次自动把30天内未访问的训练数据下沉到对象存储或蓝光存储,热层只保留最近7天的checkpoint和活跃数据集。我们实测的账是这样:一个500TB的训练数据集,全放全闪存储年成本约七位数,分层后热层压到80TB,冷层走蓝光,综合成本降到原来的三成左右。

异地这条线也不能省。两地三中心对AI公司来说不是奢侈品,训练集群集中在一个机房,一次断电或光缆中断就够呛。中科热备的异地容灾模块支持150km以上同步复制,配合DNS切换实测8到18秒完成流量接管。我们对比过纯异步方案,异步在跨城链路上的RPO会退化到分钟级,对权重文件来说不可接受。

AI公司数据保护自查清单

下面这份清单是我们给几个训练团队做评估时用的,逐条过一遍就能看出短板在哪。

checkpoint的RPO是否低于10秒,还是按小时算。训练数据是否有独立于生产集群的不可变副本,副本能否抵抗凭据泄露后的删除操作。模型权重、训练数据、推理日志是否用了不同的保护策略,还是挤在同一套备份一体机上。异地副本的RTO是否实测过,切换演练多久没做了。备份存储是否支持信创环境,鲲鹏、飞腾、海光、龙芯、兆芯这5种CPU和麒麟、UOS、欧拉3种OS是否跑通。CDP副本的保留周期是否覆盖了最长的训练任务周期,72小时够不够。恢复演练是否验证过从任意时间点挂载卷,还是只验证过最新副本。

这份清单里最容易被忽略的是最后一条。很多团队备份策略写得漂亮,真到恢复时才发现只能回滚到最近一个checkpoint,中间的CDP时间点因为策略配置问题根本挂不上。容灾备份的价值不在备份动作本身,在于恢复路径是否被真实验证过。

AI公司的数据资产保护,本质上是一个RPO、RTO和成本三者的工程取舍问题。训练数据可以容忍小时级RPO,模型权重不能;推理日志可以走异步,checkpoint必须走CDP。把这些需求拆开、用对的机制去匹配,比堆一套昂贵的备份一体机管用得多。云灾备和CDP不是概念,是能在训练中断那一刻把损失从几天压到几分钟的具体工程手段。

作者:李云龙

发布日期:2026年9月28日

返回列表