
直接说结论算力这个事儿圈外人看着是一串数字圈内人看着是一堆坑。前阵子有朋友拿着两张宣传页来问我一张写着“AI算力 200 TOPS”另一张写着“算力 120 TFLOPS”问我哪个强。我说你先别急着比大小得先搞清楚这两个单位根本不是一回事而且就算单位统一了背后还藏着精度这个变量FP32、FP16、INT8之间的差距能有三五倍甚至十几倍。这篇文章我就把自己这些年查资料、看参数、实测对比的经验一次性说清楚看完你再去选卡、看产品、写方案心里就有底了。1. 先搞懂“算力”到底在算什么1.1 算力不是单一指标而是一套换算体系很多人在第一步就掉坑里了。大家张嘴闭嘴“算力”但这个词在不同的语境下指的东西完全不一样。在芯片设计公司嘴里算力是晶体管数量和频率的堆叠在云厂商那里算力是可租用的GPU小时数到了做模型推理的工程师嘴里算力又变成了一次推理请求的延迟和吞吐量。所以严格来说“算力”是一个很粗颗粒度的口语概念真正能在技术层面拿来对比的是后面跟着的那些量化单位比如TOPS、TFLOPS。我自己的理解是把算力想象成一个物流公司。TOPS和TFLOPS都是这个物流公司的“每小时包裹处理量”但问题在于“包裹”的定义不一样有的公司按“标准箱”统计有的公司按“小件”统计有的公司甚至把“看一眼包裹就算处理完”也计入总量。如果你不看清楚统计口径就盲目比较数字大小那就像拿外卖员的送单量和货车司机的吨公里数对比一样没有意义。继续说前面的问题。200 TOPS和120 TFLOPS哪个强答案是看精度看场景看持续性能单看数字没有任何意义。TOPS通常用来衡量整数运算能力尤其是INT8精度下的AI推理算力而TFLOPS大多指浮点运算能力常见于FP16、FP32的训练场景。一块芯片的宣传页上往往会把最高的那个数字放在最显眼的位置这个数字可能是INT8稀疏算力和真实跑模型时的稠密FP16算力完全不是一回事。1.2 为什么算力概念现在这么热以前大家谈电脑性能看的是CPU主频、内存大小、显卡显存。现在生成式大模型火起来之后所有厂商都开始把“算力”当成核心卖点手机发布会讲NPU算力汽车发布会讲智驾芯片算力云服务商讲总算力池规模。原因很简单模型参数规模在快速膨胀而算力直接决定了一个模型能不能跑起来、跑多快、能跑多大的版本。其实可以算一笔账。一个70B参数的大模型光参数就要占大约140GB的显存按FP16计算。就算用A100 80G这样的卡也得至少两张才能把权重塞进去这还没算KV Cache和中间激活值。所以你会发现所有和AI相关的产品都在宣传算力因为算力就是AI应用的物理天花板。理解了这一点你就能明白为什么“算力、TOPS、TFLOPS、精度”这些问题必须弄清楚——这不是考试知识点是挑选硬件的实际需求。2. TOPS和TFLOPS一对容易混淆的亲兄弟2.1 TOPS整数运算的计数单位TOPS的全称是Tera Operations Per Second也就是每秒万亿次操作。注意这里是“Operations”而不是“Floating-point Operations”所以TOPS是一个更宽泛的单位理论上整数运算、浮点运算都可以用TOPS表示但在现代AI芯片的宣传语境里TOPS几乎专指整数运算能力尤其是INT8精度下的运算次数。为什么AI推理这么看重INT8算力因为在图像分类、目标检测、语音识别这类推理任务中模型已经训练好了权重和激活值对精度的敏感度下降用INT8量化后精度损失通常很小但运算速度可以翻好几倍内存占用也能降低到原来的四分之一。所以硬件厂家在宣传端侧芯片时比如手机NPU、智能驾驶芯片都会主推INT8 TOPS这个数字因为它最大、最好看。不过这里有个坑同是TOPS有的芯片标的是“稀疏算力”有的标的是“稠密算力”。稀疏和稠密的区别在于AI模型中有大量权重为0稀疏计算可以跳过这些0值运算从而提速。NVIDIA的Ampere架构开始引入结构化稀疏支持张量核心可以在理想情况下把INT8算力翻倍。但前提是模型经过剪枝并满足2:4结构化稀疏模式实际项目中很难做到。所以买卡的时候看到TOPS标称值先问一句这是稠密算力还是稀疏算力2.2 TFLOPS浮点运算的含金量TFLOPS的全称是Tera Floating-point Operations Per Second每秒万亿次浮点运算。和TOPS相比TFLOPS的含金量在于“浮点”两个字。浮点数可以表示非常大和非常小的数是科学计算、模型训练的必需品因为训练过程中的梯度更新、损失计算都需要足够的数值范围和精度。所以当你看到一张训练显卡的参数时主要看的就是FP32 TFLOPS或FP16 TFLOPS而不是TOPS。用一个生活化的例子来理解。假设你在做一个超大规模的计算比如模拟天气变化中间会反复出现各种小数运算整数运算直接做不了必须浮点运算。FP16和FP32的区别可以理解为FP16像一把最小刻度是毫米的尺子FP32像一把最小刻度是微米的尺子。测桌子长度毫米够了又快又省事但要测芯片表面的蚀刻线宽毫米刻度就不够用了。不同的浮点精度同样的硬件峰值算力差别很大。以NVIDIA A100为例FP32算力约19.5 TFLOPSTF32约156 TFLOPSFP16约312 TFLOPSINT8约624 TOPS。这里有个规律精度每降低一半峰值算力差不多翻一倍或者更多因为同样的晶体管可以做更多次低精度运算。这也是为什么厂商们热衷于宣传FP16甚至更低精度的算力——数字漂亮。2.3 TOPS和TFLOPS的换算法则尽管TOPS和TFLOPS的定义不一样但在AI计算这个语境下它们确实存在一个大致的换算关系方便做粗略对比。核心逻辑是一次INT8整数操作可以视为等价于一次FP16浮点操作的一部分工作量而稠密INT8 TOPS通常约等于稠密FP16 TFLOPS的2倍。简单换算公式不代表实际性能完全对齐FP16 TFLOPS × 2 ≈ INT8 TOPS同等硬件架构下稀疏特性关闭时FP32 TFLOPS ≈ FP16 TFLOPS ÷ 2大部分AI加速硬件单颗AI芯片的“FP16有效算力”大约只有理论峰值的30%~50%所以开头那个问题可以重新回答了如果“200 TOPS”是指INT8稠密算力“120 TFLOPS”是指FP16算力那两者实际上比较接近200 ≈ 120×2 的附近区域但最终还是要看具体应用。如果是跑量化推理模型200 TOPS占优如果是用FP16做微调训练120 TFLOPS更合适。实际选购时不要只看某一个数字一定要把所有精度下的算力表都找出来再结合自己的场景判断。3. FP32、FP16、INT8精度的底层逻辑3.1 从FP32到FP16数值范围和精度怎么变FP32是单精度浮点数用32位二进制表示一个数其中1位符号位、8位指数位、23位尾数位。它能表示的最大值大约是3.4×10的38次方最小值正常范围能到1.2×10的-38次方相对精度约1e-7。FP16则用16位表示1位符号位、5位指数位、10位尾数位最大值只有65504虽然范围小了不少但在AI场景中大部分梯度值都落在合理的范围内只要做好梯度裁剪和混合精度策略FP16完全够用。为什么训练时不能用INT8因为反向传播需要计算梯度梯度值的分布往往很宽而且对精度的要求比前向传播高得多。如果梯度被量化到INT8很多小的梯度值会直接被抹掉变成0模型就无法收敛。所以主流训练方案都是FP32或混合精度FP16存权重和梯度FP32做主权重更新。推理阶段就不一样了前向传播只是计算预测结果对中间数值的微小误差容忍度更高所以推理可以大胆用INT8。这里要额外提一下BF16这个变种。Google在TPU上推了BF16bfloat16和FP16一样占16位但指数位8位、尾数位7位。它牺牲了精度、保住了范围这让它在训练中不容易溢出深度学习框架对BF16的支持也原来越好。NVIDIA A100及之后的GPU都支持BF16很多大模型训练跑BF16而非FP16就是因为BF16的动态范围接近FP32不用操心梯度溢出问题。3.2 INT8量化推理加速的黄金选择INT8量化就是把连续的浮点数值映射到-128到127的整数区间。直觉上损失似乎不可避免但实际效果却经常出奇地好。一个原因是深度学习模型的权重和激活值往往集中在一个很小的数值范围内比如-1到1之间对这个范围做映射精度损失能够控制得很低另一个原因是即使某些层的权重被粗糙量化了后面紧跟的归一化层和激活函数会在一定程度上“吸收”这些误差。我做过一个实际项目把一个YOLOv5s目标检测模型从FP16转为INT8量化在边缘设备上推理精度从mAP 0.87降到了0.85只降了2个点但是推理延迟从30毫秒降到了12毫秒吞吐量提升接近2.5倍。这就是为什么业界一边倒地推动量化推理因为收益实在太明显了。当然INT8不是万能的。如果模型本身很小比如MobileNet这类轻量网络量化导致的相对损失可能更明显因为模型的冗余度低容错空间小。如果模型中存在对数值极其敏感的层比如某些注意力机制量化后也可能出现精度骤降。所以在落地时通常要做量化感知训练QAT或者在量化后做校准数据集上的验证不能直接拿量化后的模型上线。3.3 各精度算力对比表看一眼就懂既然所有厂家都会标各种精度下的算力那我把几款主流硬件的理论峰值整理成了一张表方便你后续查阅。注意这是理论峰值实际跑模型时要打个折扣而且针对不同算子表现差异会很大。硬件平台FP32 TFLOPSFP16/BF16 TFLOPSINT8 TOPS典型场景NVIDIA T48.165Tensor Core130推理、轻量训练NVIDIA A10019.5312624大模型训练、推理NVIDIA RTX 409082.6165FP16330INT8 Tensor Core桌面推理、微调高通骁龙8 Gen 3约0.7FP32 GPU约3.5FP16约34INT8 NPU手机端侧AI特斯拉HW 4.0不公开不公开约500INT8密集自动驾驶看到这个表你应该能理解为什么搞训练的人眼里只有A100/H100搞端侧部署的人天天琢磨NPU的INT8算力。场景不同目标的精度类型完全不同自然关注的点也千差万别。4. 算力实战看懂参数表避开花式宣传的坑4.1 看懂一张GPU参数页的关键行不管你是买整机、租云GPU还是采购边缘设备拿到参数表后我建议按下面的优先级去看显存容量和带宽这决定了模型能不能装下、数据搬运快不快。大模型时代显存往往比算力更容易成为瓶颈。A100有40G和80G两个版本选错版本可能直接把70B模型卡死在加载阶段。FP16/BF16稠密算力这是训练的硬指标所有深度学习框架的前向反向都在这个精度附近运行。INT8算力推理优化的关键决定量化模型的最高吞吐潜力。FP32算力做传统HPC科学计算、CAE仿真时看它AI场景反而不用太在意。散热和功耗理论峰值再高如果散热压不住几秒钟就降频实际性能大打折扣。选购时一定要看“持续算力”而不是“峰值算力”。注意有些卡片标注“AI算力”时不说明精度绝大多数情况下默认是INT8。如果只标了一个孤零零的大数字先按INT8理解再去官网找详细规格确认。4.2 云算力平台怎么选按算力还是按卡时我身边不少人习惯直接在AutoDL、恒源云这类算力云平台上租GPU因为这比买卡灵活多了。但选实例的时候同样绕不开算力参数的问题。我的经验是先明确你的任务属于训练、微调还是推理再决定机型。如果是大模型微调优先看显存和卡间通信NVLink/NVSwitch算力其次。很多人在租卡时只盯着“A100 40G”这个标签结果发现跑LLaMA-13B微调时单卡显存不够被迫开多卡可如果是PCIe版A100卡间通信带宽只有NVLink版的三分之一左右训练效率掉得让人抓狂。如果是推理部署关注性价比时不能只算单价还要结合吞吐量。举个例子T4的单卡时价格比A100便宜很多但INT8的T4只能跑约130 TOPSA100能跑624 TOPS同样是跑一批请求A100完成的时间可能只要T4的三分之一。云厂商按时间计费你看着每小时单价便宜实际上单位任务成本可能反而更高。4.3 端侧AI的算力参考从手机NPU到自动驾驶芯片端侧AI部署是现在最活跃的方向之一不管是手机上的实时翻译、语音助手还是汽车上的智能驾驶都依赖端侧芯片的算力支撑。但端侧芯片的参数更加“美化过”因为厂商通常直接把INT8算力写在大标题上。举个例子手机NPU的算力在发布时会标一个“总AI算力”这个数字可能是CPU、GPU、NPU三者算力之和听起来非常夸张但实际上模型推理时主要跑在NPU上实际可用算力远低于总和。选手机时如果你是因为AI功能而关注算力重点看NPU单独标称的INT8算力。自动驾驶芯片则更复杂一些因为它的算力分配不只是跑一个神经网络还要同时处理多个摄像头、激光雷达的数据融合、路径规划、控制输出等任务。以一颗标称500 TOPS的智驾芯片为例实际留给感知模型的算力可能只有这个数字的60%~70%因为系统还要给其他组件留余量。只有在上述场景都了解清楚之后才能比较客观地评估“算力”是否够用。4.4 线上项目复现算力参数如何影响实验设计最后说个实操层面的东西。很多初学者在跑开源项目时喜欢直接照搬GitHub上的依赖和环境配置结果发现同样的模型在别人的A100上跑得飞快到自己手里的消费级显卡上就爆显存或慢得离谱。这不是代码问题而是算力资源的错配。跑实验之前建议你花10分钟做一次“算力预算”规划模型参数量是多少比如7B那就是140亿参数训练/微调需要什么精度FP16混合精度算力要求批量大小和序列长度是多少决定了显存需求数据加载是否存在瓶颈CPU和内存够不够有了这四个答案再去选择GPU型号或云实例就能少走很多弯路。比如一个7B模型的LoRA微调在RTX 4090上用bitsandbytes的4-bit量化加LoRA显存占用可能控制在12~16G之间完全能跑但如果是全参数微调同样的模型4090直接爆显存必须上A100或H100这类大显存卡。这就是算力参数对实际操作的直接影响。5. 常见问题与避坑经验这些年踩过的算力坑5.1 为什么我买的显卡算力比宣传的低那么多这个问题十个人里有九个会遇到。根本原因在于“理论峰值”和“实际性能”之间存在一条巨大的鸿沟。理论峰值是芯片在一个时钟周期内所有计算单元都在满负荷工作时的极限值而实际跑模型时访存延迟、算子调度、框架开销、散热降频都会拖慢速度。我实测过一张RTX 3090标称FP16算力约71 TFLOPS但在实际PyTorch训练中一个小型BERT模型只能跑到20 TFLOPS左右利用率不到30%。这不是显卡有问题而是小模型的算子计算量不够密没有把GPU的资源完全喂饱。想提高算力利用率可以做几件事增大批量大小、开启TensorFloat-32TF32、用TensorRT做推理优化、开启CUDA Graph减少内核启动开销。5.2 “AI算力超过XX TOPS”的话术后面藏着哪些修饰词厂商话术里常见的修饰词包括“稀疏”、“峰值”、“FP16”、“INT8”、“极端条件下”等。比如“AI算力300 TOPS”可能指INT8稀疏算力而同一颗芯片的INT8稠密算力可能只有150 TOPS。如果是FP16可能直接缩水到75 TFLOPS。所以看到宣传页上的数字先别激动去翻详细规格表或者官网白皮书找到稠密、持续、端到端的参数再比较。注意很多手机厂商发布AI功能时喜欢拿“大模型跑在端侧”说事背后依赖的就是NPU的INT8算力。但实际端侧模型大多是经过蒸馏和量化的小模型体积可能只有几十到几百MB对算力的需求并没有想象中那么高更关键的反而是内存带宽和系统调度能力。5.3 工具链带来的算力折扣往往比硬件本身还要大这是资深从业者才懂的心法硬件提供了算力上限但框架和编译器的优化水平决定你能摸到多高的天花板。同样一张显卡用PyTorch默认配置跑和用TensorRT、ONNX Runtime加FP16推理优化跑吞吐量可能差3~5倍。NVIDIA TensorRT的层融合、精度校准、内核自动调优能把INT8推理的性能榨干而PyTorch默认的即时执行模式很多算子没有完全优化跑起来自然是浪费了不少硬件算力。做端侧部署更明显。同样的NPU用厂商自带的SDK如高通SNPE、联发科NeuroPilot优化后跑一个小型分类模型可能只要几毫秒但如果你用通用框架直接怼上去可能几十毫秒都跑不完。所以在评估算力时一定要把“能调用多少算力”的软件因素也算进去否则买再强的硬件也只能发愁。5.4 小项目怎么做算力预算少花冤枉钱对于个人开发者或者小团队在算力上的每一分钱都得花在刀刃上。我的建议是先在小规模数据上验证模型效果用免费的Colab或Kaggle GPU就够。如果效果OK再租云GPU做正式训练不要一上来就买卡。训练时优先用混合精度PyTorch AMP、TensorFlow 混合精度几乎无损加速。推理部署用TensorRT或ONNX Runtime量化别拿原始权重直接上生产环境。按需选择“按量计费”而非“包月包年”避免资源闲置浪费。这条路径我验证过很多次确实能帮初学者省掉大几千块的试错成本。算力是按需购买的生产资料不是攀比的收藏品。搞清楚自己的任务需要多高的峰值、多长时间、什么精度再决定怎么花钱这才是这篇长文最想传达的一点。5.5 最后再分享一个小技巧看算力时顺手算一算能效比算力除以功耗得到的就是能效比单位瓦特算力。在端侧设备上这个指标比绝对算力更重要。手机不能塞个300W的显卡芯片所以同样30 TOPS功耗5W和功耗15W的方案落地价值天差地别。我在评估边缘设备时通常会做三组测试一是用标准模型跑一遍记录实际延迟二是用功率计或系统API测整机功耗三是连续跑10分钟看是否降频。三个数据综合下来比参数表上的任何数字都有说服力。建议大家在实际选型中也把这三步测试做一遍毕竟算力这东西只有在你手里跑起来才算数。