简介:这份HCS-Pre-Sales-Intelligent Computing智能计算售前题库,面向备考华为智能计算售前认证的售前工程师、渠道技术人员及ICT从业者,帮助系统梳理服务器、存储、安全、网络与计算五大领域的核心考点。题库以选择题与判断题为主,覆盖TPM可信平台模块、Taishan服务器型号与iBMC管理接口、RAID与SSD分类、鲲鹏920处理器、GPU应用场景、网卡形态及企业标准QDKBA2096-2013等高频知识点,并附有参考答案,便于自测与查漏补缺。资源包共1个PDF文件,约183KB,轻量便携,适合打印或移动端随时刷题。目前已有1169人学习下载,可作为考前冲刺与知识点速查的实用参考。
1. 从一道 H19-381 模拟题说起:智能计算售前到底考什么
上周帮一个准备转售前岗的兄弟复盘 H19-381 的错题,他卡在一道「智算中心算力规划」的多选题上:给定 32 台 GPU 服务器、单机 8 卡、集群网络收敛比 1:1,问在训练和推理混合负载下,如何分配存储带宽和参数面网络。他背了三天题库,答案能默写,但换个参数就懵。这不是他一个人的问题——HCS-Pre-Sales-Intelligent Computing(智能计算售前)认证的题库,表面考的是记忆,实际考的是你能不能把算力、网络、存储、能耗这几条线在客户场景里串起来。
这篇笔记不打算给你一份「背了就能过」的答案列表,而是把 H19-381 智能计算售前题库背后的知识域拆开,告诉你每类题在考什么、参数怎么推、现场怎么讲。适合两类人:一是正在刷 H19-381 题库、想搞懂「为什么选这个」的备考者;二是刚转智能计算售前、需要一套可复用的算力方案推演方法的从业者。题库是死的,客户场景是活的,把题库当索引去补知识域,比死记选项有用得多。
2. 拆解 H19-381 题库的四大知识域与出题逻辑
2.1 算力规划题:从 GPU 卡数反推集群规模
H19-381 题库里占比最高的一类题,是给定模型参数量、训练数据量、目标训练周期,反推需要多少张 GPU、多少台服务器。这类题的核心公式不复杂,但坑在「有效算力」的折算上。
常见做法是先用理论算力估算,再乘一个经验利用率。以 FP16 训练为例,单卡理论算力记作 P,实际能跑到的有效算力通常是理论值的 30%~45%,取决于集群规模、并行策略和通信开销。题库里如果没给利用率,默认按 40% 估,这是行业里比较稳的中间值。
# 训练算力需求估算:给定模型和数据,反推GPU卡数 # 参数说明: # N: 模型参数量(单位:十亿,B) # D: 训练token数(单位:十亿,B) # target_days: 目标训练天数 # gpu_peak_tflops: 单卡FP16峰值算力(TFLOPS) # utilization: 有效算力利用率,默认0.4 def estimate_gpu_count(N, D, target_days, gpu_peak_tflops, utilization=0.4): # 训练总计算量约 6 * N * D FLOPs(前向+反向) total_flops = 6 * N * 1e9 * D * 1e9 # 单卡每天有效算力:峰值 * 利用率 * 秒数 per_gpu_per_day = gpu_peak_tflops * 1e12 * utilization * 86400 # 需要的卡数 = 总计算量 / (单卡日算力 * 天数) gpu_count = total_flops / (per_gpu_per_day * target_days) return int(gpu_count) + 1 # 向上取整 # 示例:70B模型,2T token,30天训完,单卡FP16峰值312 TFLOPS print(estimate_gpu_count(70, 2000, 30, 312))这段代码的逻辑是:总计算量按 6ND 估(这是训练 FLOPs 的经典近似),单卡日有效算力用峰值乘利用率再乘一天的秒数。参数里最容易拍脑袋的是utilization,小集群(几十卡)能到 0.45,上千卡的大集群因为通信墙,掉到 0.3 以下很常见。题库里如果出现「千卡集群」字样,利用率要往下调。
提示:算出来的卡数还要向上取整到单机卡数的整数倍,比如算出 250 张、单机 8 卡,实际要按 256 张、32 台规划,多出来的卡用于容错和负载均衡。
2.2 网络选型题:参数面、数据面、业务面怎么分
智能计算售前题里,网络部分最爱考的是「三张网」的划分:参数面(梯度同步)、数据面(存储读写)、业务面(管理调度)。H19-381 题库里经常给一个集群规模,问参数面该用 InfiniBand 还是 RoCE、收敛比设多少。
选型逻辑其实就一条:看通信量和延迟敏感度。参数面做 AllReduce,对延迟和丢包极其敏感,大规模训练优先 IB,中小规模可以用 RoCEv2 但必须配无损网络(PFC+ECN)。数据面走存储流量,带宽大但延迟容忍度高,收敛比可以放到 3:1 甚至 5:1。业务面千兆都够。
| 网络平面 | 典型协议 | 收敛比 | 延迟要求 | 题库常见考点 |
|---|---|---|---|---|
| 参数面 | IB / RoCEv2 | 1:1 或 2:1 | 微秒级 | 无损网络配置、PFC 优先级 |
| 数据面 | RoCE / TCP | 3:1~5:1 | 毫秒级 | 存储带宽与 GPU 配比 |
| 业务面 | 以太网 | 无严格要求 | 毫秒级 | 管理口冗余 |
收敛比这个参数,题库里经常换个说法叫「超订比」。1:1 就是无收敛,下行和上行带宽相等,成本最高但训练效率最好。实际项目里,参数面做到 1:1 的客户不多,2:1 是性价比拐点,再往上训练效率掉得厉害。
2.3 存储配置题:带宽和 IOPS 哪个先算
存储题在 H19-381 里属于「看起来简单、算起来容易漏」的类型。题目通常给训练数据集大小、epoch 数、单 epoch 时间,问需要多少存储带宽。很多人直接拿数据集大小除以时间,漏了数据加载的并发和预取。
正确做法是先算「每卡每秒需要喂多少数据」。假设单卡 batch size 为 B、单样本大小 S 字节、单步耗时 T 秒,则单卡数据带宽需求 = B × S / T。再乘卡数,就是存储集群要提供的聚合带宽。IOPS 则要看小文件比例,训练数据集如果是大量小文件,IOPS 会成为瓶颈,这时候要上并行文件系统或者做数据打包。
# 用 fio 快速验证存储节点实际能跑出的带宽和IOPS # 顺序读带宽测试(模拟大文件训练数据读取) fio --name=seq_read --ioengine=libaio --direct=1 --bs=1M \ --numjobs=8 --rw=read --size=10G --runtime=60 --group_reporting # 随机读IOPS测试(模拟小文件加载) fio --name=rand_read --ioengine=libaio --direct=1 --bs=4k \ --numjobs=32 --rw=randread --size=1G --runtime=60 --group_reportingbs=1M的顺序读测的是大文件吞吐,bs=4k的随机读测的是 IOPS。售前阶段如果客户已有存储,这两个命令跑一遍,比看厂商标称值靠谱。参数里numjobs模拟并发客户端数,direct=1绕过页缓存,测的是真实落盘性能。
2.4 能耗与制冷题:PUE 和机柜功率密度
这类题在题库里占比不高但容易丢分,因为很多人只记 PUE 公式,不会结合机柜功率密度算制冷方案。常见考法是:给定单机柜功率和机房 PUE 目标,问该用风冷还是液冷。
判断线大致是:单机柜功率 15kW 以下风冷能扛,15~30kW 要用冷板式液冷,30kW 以上基本只能浸没式或强液冷。PUE 方面,风冷机房做到 1.4 算不错,液冷能压到 1.1~1.2。题库里如果出现「PUE 低于 1.2」的要求,直接选液冷方案,不用犹豫。
3. 用 H19-381 题库做售前方案推演的实操路径
3.1 把题目参数翻译成客户需求清单
刷题和做方案最大的区别是:题目给全了参数,客户不会。所以拿到一道 H19-381 的算力规划题,先别急着套公式,把题目里的隐含条件列成一张需求清单。
比如题目说「某客户要建一个支持 70B 模型训练的智算中心」,你要拆出:模型参数量 70B、训练数据量未知(要问)、目标训练周期未知(要问)、精度 FP16 还是 BF16、并行策略是 TP 还是 PP、集群规模上限、预算范围。这些信息题库不会全给,但售前现场必须问全。
我一般会做一张对照表,左边是题库参数,右边是客户现场要确认的问题。这样刷题就不是背答案,而是练「问对问题」的能力。
3.2 从题库选项反推方案边界
H19-381 的选项设计有个规律:错误选项往往对应「参数取极端值」的情况。比如一道网络收敛比的题,正确选项是 2:1,错误选项里一定有 1:1(成本过高)和 5:1(训练效率崩)。刷题时把错误选项为什么错想清楚,就等于把方案的边界条件摸了一遍。
具体做法:每道错题旁边标注「这个选项在什么条件下反而正确」。比如 1:1 收敛比在「小规模、预算充足、追求极致训练效率」时就是对的。这样积累下来,你手里就有了一套「什么场景选什么参数」的决策树,比死记答案有用。
3.3 用模拟题做 15 分钟方案速讲
售前岗的核心能力是「15 分钟讲清一个方案」。拿 H19-381 题库里的一道综合题,强迫自己在 15 分钟内输出一个完整方案框架:算力规模、网络架构、存储配置、能耗估算、大致预算。
方案速讲模板(15分钟版): 1. 需求复述(2分钟):客户要做什么模型、多大数据、多久训完 2. 算力规划(4分钟):卡数、服务器数、利用率假设 3. 网络架构(3分钟):三张网选型、收敛比、关键设备 4. 存储与能耗(3分钟):带宽需求、PUE目标、制冷方式 5. 风险与边界(3分钟):哪些参数敏感、哪些地方可能超预算这个模板练熟了,题库里的综合题基本都能覆盖。关键是第 5 部分「风险与边界」,这是区分背题者和真懂的人的分水岭。
4. 智能计算售前刷题避坑:5 个血泪教训
4.1 现象:算力估算结果和题库答案差一倍
原因:利用率取值不同。题库默认 0.4,你用了 0.8 的理论值,结果自然差一倍。 解决:统一按 0.35~0.45 估,题库没给就取 0.4。如果题目明确说「小规模集群」,可以取 0.45;说「千卡以上」,取 0.35。
4.2 现象:网络题选了 RoCE 但答案要 IB
原因:没看清题目里的规模关键词。题库里出现「千卡」「大规模」「极致性能」时,参数面默认选 IB。 解决:记一条硬规则——参数面规模超过 500 卡,优先 IB;500 卡以下,RoCEv2 配无损网络可以打。数据面和业务面永远选以太网。
4.3 现象:存储带宽算出来偏小,被判错
原因:漏了数据预取和并发系数。实际训练时数据加载是流水线并行的,存储带宽要按「聚合需求 × 1.5」预留。 解决:算完基础带宽后乘 1.5 的安全系数,题库里如果给了「数据加载效率 80%」之类的条件,再除以这个效率。
4.4 现象:能耗题 PUE 算对了但制冷方案选错
原因:只看 PUE 没看机柜功率密度。PUE 1.2 可以用液冷实现,但如果单机柜只有 8kW,风冷也能做到 1.3,题库可能考的是「性价比最优」而不是「PUE 最低」。 解决:先算单机柜功率,再对照风冷/液冷的分界线(15kW),最后看 PUE 目标。两个条件都满足才选液冷。
4.5 现象:综合题时间不够,最后几道全靠蒙
原因:在前面的计算题上死磕,一道题算了 10 分钟。 解决:H19-381 的计算题,单题超过 3 分钟就先标记跳过,把概念题和选型题做完再回头算。售前考试考的是决策速度,不是计算精度。
5. 从题库到现场:把 H19-381 变成售前话术的进阶技巧
刷完 H19-381 题库的人容易陷入一个误区:以为考试通过就等于能做售前。实际上题库训练的是「给定条件下的最优解」,而售前现场面对的是「条件不全、需求模糊、预算卡死」的真实场景。把题库知识转化成现场话术,才是这套认证真正值钱的地方。
我的做法是给每个知识域准备一段「30 秒白话版」。比如算力规划,白话版是:「您要训 70B 的模型,按 30 天训完算,大概需要 256 张卡、32 台服务器,这是按 40% 利用率估的,实际跑起来如果通信优化得好,能省个十来张卡。」这段话里没有公式,但把关键参数和不确定性都带到了,客户听得懂,也留了后续调整的空间。
再比如网络选型,白话版是:「参数面这张网,500 卡以下我们用 RoCE 加无损配置,性价比高;上了千卡,建议直接上 IB,不然梯度同步的延迟会把训练效率吃掉一大截。」这句话把选型边界和理由都说了,客户如果有预算压力,自然会追问 RoCE 方案的具体配置,这时候你再展开 PFC 和 ECN 的参数,节奏就对了。
还有一个进阶技巧:用题库里的错误选项做「反向话术」。客户如果提出一个明显不合理的方案(比如参数面用 5:1 收敛比),你不要直接否定,而是说:「这个收敛比在数据面上没问题,但参数面如果这么配,AllReduce 的通信时间可能会超过计算时间,训练效率会掉到 30% 以下。我们可以先按 2:1 设计,如果预算实在紧,再考虑把非关键流量分离出去。」这种说法既专业又留了余地,比「你错了」管用得多。
最后说个我自己的习惯:每次刷完一套 H19-381 模拟题,我会挑三道错题,假装客户就在对面,把正确选项背后的方案讲一遍,录音回听。讲得磕巴的地方,就是知识域没打通的地方。这个习惯坚持了两个月,现场讲方案的流畅度明显不一样。题库是磨刀石,但刀要拿到现场去砍柴才知道快不快。希望帮到你。
本文还有配套的精品资源,点击获取