十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

2026年GPU云服务器选卡指南:4090、A100、H100怎么选

2026年GPU云服务器选卡指南:4090、A100、H100怎么选 今天想聊一个每隔几天就会被人问一次的问题GPU云服务器上的4090、A100、H100到底怎么选。最近这半年身边做AI工具、跑ComfyUI、微调大模型的朋友越来越多大家已经从“显存够不够大”进化到“FP16算力多少、显存带宽多少、HBM和GDDR6X到底差在哪”的阶段。这篇文章我直接把平时选卡用的参数表、估算方法和踩坑经验整理出来给2026年还在折腾GPU云服务器的人一份能直接抄作业的参考。我会按这个顺序讲先理清现在的卡型格局再做一份核心参数对比表然后按场景说选卡思路接着给出推理资源测算的实操方法最后是一堆租卡和部署过程中躲不开的坑。内容偏实操适合正在租卡跑训练、做推理、跑SD出图或者搞科学计算的人。1. 2026年的GPU云服务器卡型格局4090、A100、H100各守一段1.1 为什么A100和H100发布这么多年还在打主力先别急着看表格得先搞清楚一个现象2026年了为什么A100、H100依然是云GPU平台上的主力而新一代卡好像一直没能完全取代它们核心原因有三个生态稳定、供应充足、性价比依然能打。A100从2020年发布到现在CUDA生态、PyTorch适配、各种训练框架的兼容性早就被磨得非常成熟平台方也不需要频繁更新驱动和调度系统。H100在高端训练卡里是绝对主力尤其大模型预训练这类场景H100的FP16 Tensor Core算力和NVLink互联能力短期没有对手。而4090作为消费卡凭借极高的FP32算力和Tensor Core能力硬生生在云GPU市场杀出了一条路很多推理和微调场景根本不需要上昂贵的数据中心卡。另外还要注意2026年的云GPU供给正在分层高端市场有H200乃至新架构的卡陆续铺开但这个蛋糕主要被愿意花大钱的训练团队吃掉中间层是H100、A100、L40S、A800、H800这些专业卡性价比层长期被4090、3090把持。这三层各有各的不可替代性替换成本远没有想象中低。1.2 云GPU的租用形态整卡、切分卡、共享显存影响很大同一张卡在不同平台上给你用性能表现可能完全不同所以对比卡型之前先弄懂云平台的租用形态。第一种是整卡独享最常见你把一整张卡租下来显存、算力、带宽都是你自己的租用价格最高但性能最稳定。第二种是MIG或者vGPU切分一张A100/H100按显存切成几份比如切成4份20GB或者7份10GB。这种模式便宜但每份拿到的不光是显存变小计算单元也被隔离了性能没法按显存比例去简单换算。更关键的是MIG切分下很多CUDA能力被限制例如某些场景的利用率会明显打折。第三种是共享显存/共享算力平台按分钟计费卡上可能同时跑着好几个人的任务。你看到的nvidia-smi可能显存还剩不少但算力被别的租户占掉一大截。这种模式便宜、灵活适合调试和小规模推理但不适合对延迟有硬性要求的正式任务。所以后面所有参数对比都是基于“整卡独享”这个前提。如果你租的是切分卡或共享卡性能参数要做减法而且减法幅度不是线性的。2. 主力卡参数全对比显存、带宽、算力一张表看懂2.1 参数怎么读FP32、Tensor Core、带宽到底代表什么很多人在参数表面前容易懵我先花两分钟把几个关键指标讲明白。FP32算力也就是单精度浮点运算能力单位TFLOPS代表这张卡计算常规浮点运算有多快。这个指标对科学计算、一般仿真、部分图形渲染很有参考意义但对大模型的训练和推理不是唯一决定因素。Tensor Core算力单位也是TFLOPS代表矩阵乘法的专用加速能力。深度学习里最重要的算子就是矩阵乘法所以这个数对训练和推理来说比FP32重要得多。一般在云平台看卡型先看FP16/BF16的Tensor Core算力这一档是混合精度训练的主力。显存带宽单位GB/s常被忽略但极其关键。数据要从显存搬到计算核心才能算搬运速度就是带宽。带宽低的话就算算力再强模型参数一多计算单元也会空等数据。做推理的时候这个指标很多时候比算力还重要。还有一个容易混淆的点有些厂商标“稀疏算力”比稠密算力高将近一倍但那是利用了2:4结构化稀疏之后的理论值实际业务很少能用满。我下面的表统一只写稠密算力这是我们落地时更真实的数据。如果你看到“989 TFLOPS”和“1979 TFLOPS”两个数字前者是稠密后者是稀疏别被大数字忽悠。2.2 2026年主力卡型参数对照表下面这张表覆盖了2026年云GPU平台最常见的几张卡参数按整卡方案填写。65536列里有若干卡型因为产品定位或市场版本不同NVLink互连速度会有差异我也一并标出来。卡型显存容量/类型显存带宽FP32算力Tensor FP16/BF16稠密Tensor FP8稠密功耗NVLink互连RTX 409024GB GDDR6X1008 GB/s82.6 TFLOPS330.3 TFLOPS未宣传450W无RTX 309024GB GDDR6X936 GB/s35.6 TFLOPS142 TFLOPS未宣传350W无A100 80GB80GB HBM2e2.0 TB/s19.5 TFLOPS312 TFLOPS不支持400W600 GB/sA800 80GB80GB HBM2e2.0 TB/s19.5 TFLOPS312 TFLOPS不支持400W400 GB/sH100 SXM80GB HBM33.35 TB/s67 TFLOPS990 TFLOPS1980 TFLOPS700W900 GB/sH800 SXM80GB HBM33.35 TB/s67 TFLOPS990 TFLOPS1980 TFLOPS700W400 GB/sH200141GB HBM3e4.8 TB/s67 TFLOPS990 TFLOPS1980 TFLOPS700W900 GB/sL40S48GB GDDR6864 GB/s91.6 TFLOPS362 TFLOPS约733 TFLOPS350W无V100 32GB32GB HBM2900 GB/s15.7 TFLOPS125 TFLOPS不支持250W300 GB/s这张表我建议配合一个简单的选卡逻辑来看先问自己显存够不够装下模型再问业务是训练还是推理最后才去比算力大小。顺序反了很容易被高参数卡带偏。2.3 逐卡点评谁贵得有道理谁是性价比黑马先聊4090。它最吸引人的地方在于24GB GDDR6X显存对大多数7B、13B模型的推理和LoRA微调刚刚够用FP16 Tensor Core算力330TFLOPS甚至超过A100的312TFLOPSFP32算力更是远超A100。单卡跑任务的时候4090在很多场景下表现并不比A100差价格却低一大截。但它的短板很明确显存带宽只有1TB/s左右多路并发推理时吞吐很容易被带宽卡住另外4090没有NVLink多卡通信只能走PCIe跨卡训练效率有限。A100 80GB是数据中心里的常青树。单看FP16算力312TFLOPS不如4090但它有2TB/s带宽、600GB/s NVLink以及极其稳定的企业级驱动支持。多卡训练、需要把大模型完整放进显存的场景A100是性价比和安全感的平衡点。A800作为它的特供版本算力几乎一致只是NVLink从600GB/s降到400GB/s多卡训练时通信会有差距但单卡业务完全没感知。H100 SXM则是高端训练的硬通货。FP16算力990TFLOPS带宽3.35TB/s单卡顶得上好几张A100预训练大模型、长上下文推理这类吃计算密度的任务能明显拉开差距。H800算力相同互连砍掉一半以上仅做单卡推理或者对卡间通信要求不高的任务可以选但真要跑大规模多卡训练还是优先原版。H200则更像“大显存版本的H100”141GB显存加4.8TB/s带宽对需要超大KV Cache或全量加载上百亿参数模型的场景特别实用。L40S是这几年的黑马48GB GDDR6显存FP16 Tensor 362TFLOPSFP8也能打而且还带了很强的图形渲染能力。它定位是AI推理、视频生成、图像处理和虚拟化桌面通用综合性极强。V100则属于预算有限时的入门选择32GB显存勉强能跑些老模型但算力和带宽都不太跟得上2026年的需求适合学生项目或简单任务。3. 按业务场景选卡训练、推理、出图、仿真各取所需3.1 大模型微调与训练先看显存预算再看卡间互联如果你租GPU云服务器是为了微调大模型第一步不是看算力而是看你到底要多少显存。全参数微调7B模型FP16混合精度下光优化器状态、梯度和激活值就能把显存吃得很紧一般建议至少40GB以上A100 80GB或者H100 80GB最稳。如果只是做LoRA/QLoRA这类参数高效微调24GB的4090就很香4bit量化之后7B模型显存占用能压到6-8GB4090跑起来游刃有余。我建议微调场景的选卡优先级是7B及以下参数、LoRA/QLoRA、单卡能跑的情况直接上4090性价比最高13B以上LoRA微调考虑A100 80GB或L40S显存余量更足真要全参微调或者预训练H100系列甚至H200才是合理选择这里尤其要看多卡NVLink是否顺畅。多卡训练还有一个容易忽略的问题通信带宽。4090之间没有NVLink只能走PCIe数据同步开销很大两张4090跑分布式可能比单张还慢而A100/H100的NVLink能显著降低通信瓶颈。所以别只看单卡参数多卡训练就优先选H100/A100这类原生数据中心卡。3.2 推理部署与llama.cpp带宽比算力更常成为瓶颈推理和训练的逻辑很不一样。训练时要把数据一遍遍喂给模型吃的是算力推理时模型权重已经固定每生成一个token都要把全部权重从显存搬一遍所以更吃带宽。llama.cpp场景尤其典型。它支持把模型一部分放在GPU、一部分留在CPU通过--n-gpu-layers参数控制。我建议先估算模型权重大小比如7B FP16权重约14GB24GB的4090装得下可以--n-gpu-layers 99尽量全放GPU如果模型超过显存再把部分层留在CPU但生成速度会明显下降因为CPU和GPU之间来回搬权重极其耗时。从带宽角度分析推理选型A100的2TB/s带宽比4090高出一倍但单路并发时差距没有翻倍那么夸张一旦你要同时服务8个、16个用户A100的带宽优势就被彻底放大。所以我自己的经验是单用户或低并发用4090高并发API服务、需要稳定延迟优先A100/H100要跑超长上下文的模型H200这种大显存卡才不会被KV Cache逼到反复offload。3.3 ComfyUI、SD出图和视频生成Tensor Core与显存余量都要看ComfyUI这类图像生成工具底层吃的是Stable Diffusion或视频模型推理主要靠UNet和Transformer里的矩阵乘法Tensor Core算力直接影响出图速度。实测下来4090在SD XL出图上明显快过A100原因就是FP16 Tensor算力比A100高而且单张图显存占用一般不超过15GB24GB显存够用。视频生成模型就不同了像一些开源视频模型动辄需要20GB以上显存甚至要跑多卡并行。L40S的48GB显存在这里很吃香一张卡能装下更大diffusion模型如果预算有限4090配合Kohya或ComfyUI的显存管理插件也能凑合跑但要习惯偶尔的爆显存和offload带来的速度损失。我个人在ComfyUI场景的建议是纯SD 1.5/SDXL出图4090其实是目前云GPU的最佳性价比需要跑大视频模型或长时间批量任务优先L40S或A100这类大显存卡千万不要为了省几块钱去租共享卡出图速度能掉到你自己都怀疑人生。3.4 科学计算与数值仿真FP64这道关卡消费卡直接出局MATLAB、ABAQUS、VASP、Gazebo这类科学计算和工程仿真软件很多地方需要FP64双精度计算。这时候4090就有个致命短板其FP64算力被砍到极低大概只有1.3TFLOPS左右跑高精度仿真会慢得离谱。A100的FP64算力约9.7TFLOPSH100能做到34TFLOPS左右这才是科学计算真正需要的级别。V100的FP64约为7.8TFLOPS虽然老但在这类场景下甚至比4090更能打。所以做数值仿真的朋友我只说一句直接去看FP64参数不要因为4090的FP32和Tensor很强就“顺手”租了否则一个算例跑上几周不是开玩笑。MATLAB调用GPU时可以用gpuDevice查看是否有可用设备用gpuArray把数据放到显存ABAQUS则要看是否安装了GPU加速模块。这些工具的坑在于很多函数库默认不开GPU支持光有卡还不够软件层也要配置好。4. 推理显存与算力测算实操租卡前先算一遍4.1 显存占用怎么估算权重、KV Cache、临时buffer三块相加很多人在云平台选了实惠的卡结果模型一加载就Out of Memory原因是只算了模型权重没算KV Cache和临时buffer。显存占用可以拆成三部分第一部分是模型权重。FP32每参数占4字节FP16/BF16每参数占2字节INT8/FP8每参数占1字节INT4量化大约是0.5字节。假设一个7B参数的模型FP16权重就是7×214GBINT8权重直接减半到7GB。第二部分是KV Cache。对于自回归模型每个请求在推理过程中都要缓存中间计算结果。粗算公式是KV Cache大小约等于2×层数×KV头数×头维度×序列长度×batch size×每元素字节数。这套公式看起来繁琐实战中我一般按经验值估算7B模型在4096上下文下、batch为1KV Cache大约0.5GB14B模型大约1GB上下文长度翻倍KV Cache也翻倍。第三部分是激活值和临时buffer。推理时一些中间激活、通信缓冲通常按模型权重的10%-30%做余量。假设FP16 7B模型需要14GB权重加0.5GB KV Cache我再预留大概2-4GB余量那么显存不低于20GB才安心24GB的4090刚好踩线。4.2 并发和吞吐怎么算带宽决定decode速度推理阶段尤其是自回归生成每生成一个token都需要把模型权重整个从显存读一遍所以理论上的decode极限速度可以粗略用“显存带宽÷模型权重大小”来算。拿7B FP16模型举例权重14GB。A100 80GB带宽2000GB/s理论极限约每秒140个token4090带宽1008GB/s理论极限约每秒72个token。实际运行中受内存延迟、算子效率、部署框架开销影响大概只能达到理论值的40%-60%所以A100单路decode大约能到60-85 token/s4090大约30-45 token/s。但推理服务不可能只跑一路请求。每增加一个并发用户KV Cache会多占一份显存decode速度也会被多个请求瓜分。于是你会看到低并发时4090够用高并发时A100/H100凭借带宽优势把单位时间总吞吐远远拉开。如果要服务100个并发用户4090可能已经崩了A100还能靠更高带宽扛住。带宽在这里是实打实的硬指标不是参数表上好看的装饰。4.3 一个7B模型的完整测算示例我拿一个真实场景演示一下假设要部署一个7B FP16模型服务50个并发用户。权重14GB。上下文长度2048KV Cache约0.25GB每路50路就是12.5GB加上权重、激活平均余量总显存轻松超过30GB。所以24GB的4090根本不够装下50路并发早就触发显存溢出。要么租A100 80GB权重加KV Cache总共26.5GB左右勉强可以要么把模型量化到INT8权重变成7GB50路KV Cache约12.5GB总占用20GB以内4090也能扛。速度上做个对比4090在INT8方案下decode带宽依然受1TB/s限制理论约每秒128 token总吞吐分给50路就是约2.5 token/s每路偏慢。A100在INT8下权重7GB带宽2TB/s理论约每秒285 token总吞吐分给50路每路约5.7 token/s体感好不少。如果换成H1003.35TB/s带7GB权重理论接近每秒478 token分给50路每路接近9.5 token/s已经能作为商用API的底线了。从这个例子就能体会到选卡不能只问“模型跑不跑得动”还要问“并发跑不跑得动”。预算紧张的方案可以靠量化降低权重大小但并发一高带宽就成了无法绕开的主线。5. 租卡避坑指南驱动、CUDA、共享卡与常见报错5.1 驱动、CUDA、PyTorch版本匹配是第一步租好卡之后最容易翻车的就是环境问题很多人一进来就装PyTorch结果torch.cuda.is_available()返回False然后开始怀疑人生。严格来说这不是卡的问题是版本匹配没做对。正常流程是先跑nvidia-smi看右上角CUDA Version这个数值代表驱动支持的最高CUDA版本不是系统已经装好的CUDA版本。接下来安装PyTorch时选择不高于这个驱动版本的CUDA配套包即可。举例如果驱动显示CUDA 12.4你装pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124或者cu121通常都能用如果驱动还停留在CUDA 11.8那就只能装cu118版本。显卡相关的Linux发行版坑也多。Ubuntu这类系统上装驱动最省事的方式是用官方runfile或者distro自带包管理器但务必确认内核版本和驱动匹配。Manjaro等滚动发行版上内核一更新NVIDIA模块经常编译失败这时候nvidia-smi会直接报错解决思路一般是回退内核或用DKMS重新编译驱动模块。5.2 独享卡与共享卡的真实性能差异我在第一节已经说过云GPU平台有不同租用形态这里再展开讲几个实操细节。共享卡模式下nvidia-smi里显示的显存利用率和计算利用率都不高但任务就是慢十有八九是隔壁租户在占用L2缓存和显存带宽。我的办法是租到卡先跑一个固定基准任务比如用torch跑一个较大的矩阵乘法记录时间对比平台上公示的理论值如果明显偏慢说明卡被切过或者被人抢资源。MIG切分后的卡nvidia-smi能看出设备名带MIG标识每份的显存和计算单元都有限制。切分卡适合调试和跑小模型但如果你跑的是批量推理任务切分卡的隔离特性反而容易造成批处理效率下降因为计算单元被固定分割一个进程用不满也不会把另一份的算力借过来。另外部分平台会限制GPU功耗把一张450W的4090限制到300W跑。你看到的nvidia-smi功耗始终顶不到标称值性能自然大打折扣。租卡前最好问清是满载还是限功耗运行或者自己实测跑分别被“4090”三个字冲昏头脑。5.3 高频报错排查gpu crash dump triggered、CUDA out of memory、ComfyUI无GPUgpu crash dump triggered这个报错通常意味着显存访问异常、驱动崩溃或者GPU硬件层面出了问题。在云服务器上遇到我的第一反应是怀疑物理卡状态尤其切分卡、共享卡最容易发生。处理思路是先看dmesg或nvidia-smi -q里有没有NVRM错误再换一个物理节点试试如果频繁在不同节点复现就要和平台客服强调“疑似硬件故障”要求换卡。CUDA out of memory则是显存不够按第四节方法先算清楚需要多少显存。如果模型确实放得下还是报OOM可能是其他进程占用了显存用nvidia-smi看进程列表必要时kill -9掉遗留进程。ComfyUI无法用GPU加速九成是PyTorch装了CPU版或者环境变量CUDA_VISIBLE_DEVICES设置不对。我建议用python -c import torch; print(torch.cuda.is_available())先确认输出的设备名如果是cpu卸载重装对应CUDA版本的torch即可。还有一次我踩过路径含中文导致WebUI启动失败的坑最后把工作目录改成纯英文路径就好了这种小问题查日志很难发现。5.4 必备监控与压力测试工具GPU云服务器运维日常说穿了就是围绕“看状态、测性能、处理故障”这几件事。基础监控我用nvidia-smi和nvtop前者看显存和温度后者更直观地看每个进程占用的算力。压力测试用gpu-burn或者furmark级别的小工具跑五分钟看温度和功耗是否稳定。Ubuntu下想看整机CPU和GPU实时状态可以用htop配合nvidia-smi dmondmon能持续输出SM利用率、显存读写带宽、温度功耗比反复敲nvidia-smi高效得多。我每次交付一批新租的卡前都会跑一轮压测记录基准分后面卡变慢了一对比就知道是平台问题还是自己代码问题这是GPU运维里最实用的习惯。6. 高频问题速查表6.1 常见问题与对应处理思路问题可能原因处理建议torch.cuda.is_available()为FalsePyTorch版本与CUDA不匹配用nvidia-smi查驱动重装对应CUDA版本的PyTorch显存显示有剩余但OOM其他进程占用显存nvidia-smi查看进程清理无用进程ComfyUI生成图片很慢或CPU环境装了CPU版torch重装GPU版PyTorch并确认CUDA_VISIBLE_DEVICES任务慢但GPU利用率不高共享卡或邻居抢占带宽换独享卡或压测对比平台理论值出现gpu crash dump triggered驱动异常或硬件故障查看NVRM日志换节点测试必要时让平台换卡多卡训练速度不升反降消费卡无NVLinkPCIe通信瓶颈换带NVLink的数据中心卡或减少通信频率MATLAB报无GPU设备gpuDevice未找到或CUDA不匹配查驱动版本配置MATLAB支持CUDA的工具包推理并发一高就OOMKV Cache或并发数超出显存降低batch、缩短上下文、量化到INT8/FP86.2 我的最后一条选型建议根据我这几年代码和运维两头跑下来的经验2026年的GPU云服务器选型其实可以简化成三句话第一能装下模型、跑得动业务并发再去看性价比第二单卡任务、LoRA微调、SD出图这类场景4090是性价比之王不用犹豫第三高并发推理、正式多卡训练、FP64仿真老实上A100/H100甚至H200省下来的时间比省下的钱值钱得多。最后分享一个我踩过几次坑之后留下的习惯无论租什么卡先花半小时跑一遍压测和带宽实测把数字记在本子上。不要因为平台的卡型标签一样就想当然——同是4090不同平台的功耗限制、散热环境、驱动版本都可能让最终性能差出20%。磨刀不误砍柴工卡型参数表只是起点自己的实测数据才是最终答案。
返回列表