十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

大模型时代大模型服务器配置清单选型研究

大模型时代大模型服务器配置清单选型研究 说大模型时代之前说一下非大模型时代的服务器非AI应用的话主要是存储服务器和应用服务器包括大数据时代也主要是存储服务器和计算服务器存储、应用、计算服务器的特点主要是CPU、内存、磁盘这三类指标够大就OK尤其内存、磁盘多线程的应用对CPU也有要求。进入大模型时代后动辄部署几个、十个二十个大模型或小模型都是需要算力的需要GPU卡的而GPU卡是相当传统有些小贵的如何合理规划算力和服务器配置也很重要了涉及到钱了、涉及ROI划不划算了。应用服务器和存储服务器按业务量去估算估算3-5年CPU、内存、硬盘的差不多够大满足未来3-5年业务增长就ok比较容易配置选型。如下述配置清单序号名称配置数量用途1存储服务器CPU≥64核主频≥2.1GHz内存≥512GB系统存储≥480G SSD数据存储≥96TB单盘不小于8TB网络端口≥4个千兆电口4个万兆光口6台提供存储空间。2应用服务器CPU≥64核主频≥2.1GHz内存≥512GB系统存储≥480G SSD数据存储≥96TB单盘不小于8TB网络端口≥4个千兆电口4个万兆光口5台提供应用服务。根据业务量适当调整存储服务器、应用服务器配置和台数如内存、硬盘、数量。大模型时代的大模型服务器包括模型训练服务器、推理服务器不同的模型偏好的配置稍有不同共同点都是需要算力支撑、需要GPU算力卡包括多模态大模型。因为模型发展太快了不能按3-5年进行估算起码1-2年内没问题后续根据业务发展情况选用更优秀的大模型和更高的算力。根据以往项目经验看华为Atlas 910B4 64G NPU卡比Atlas 300I DUO PCIE卡表现更好一些、推理速度更快一些。以下是参考的配置1模型训练服务器CPU≥128核 主频≥2.6GHz内存≥480G系统存储≥960GB SATA SSD数据存储≥8TB网络端口≥4个千兆电口4个万兆光口;eNPU卡:8*Ascend 910B HB内存64G60台支持预训练、继续预训练、全参数微调大模型2推理服务器CPU≥48核主频2.6GHz内存≥24*64GB系统存储≥2*960GB SATA SSD数据存储≥4*3.84TB NVME SSDGPU卡配置8*Atlas 300I DUO PCIE卡96GB网卡配置板载4口GE*1双口25GE*11台Qwen2.5-72B-Instruct13推理服务器CPU≥48核主频2.6GHz内存≥24*64GB系统存储≥2*960GB SATA SSD数据存储≥4*3.84TB NVME SSDGPU卡8*Atlas 300I DUO PCIE卡96GB网卡配置板载4口GE*1双口25GE*11台RYS-Llama3.1-Large4推理服务器CPU≥48核主频2.6GHz内存≥24*64GB系统存储≥2*960GB SATA SSD数据存储≥2*3.84TB NVME SSDGPU卡8*Atlas 910B4 64G NPU卡互联带宽392GB/s网卡配置板载4口GE*1自带8*200G NPU直出光口双口25GE*11台Mistral-Large-Instruct-24075推理服务器CPU≥48核主频2.6GHz内存≥24*64GB系统存储≥2*960GB SATA SSD 数据存储≥4*3.84TB NVME SSDGPU卡 8*Atlas 300I DUO PCIE卡96GB网卡配置板载4口GE*1双口25GE*11台Smaug-72B6推理服务器CPU≥48核主频2.6GHz内存≥16*64GB系统存储≥2*960GB SATA SSD 数据存储≥2*3.84TB NVME SSDGPU卡配置8*Atlas 910B4 64G NPU卡互联带宽392GB/s网卡配置板载4口GE*1自带8*200G NPU直出光口双口25GE*11台InternVL一般情况下910B卡通过nvidia-smi查看GPU使用情况300I DUO卡通过npu-smi info查看GPU使用情况。一般一台GPU服务器配置8块卡八块卡怎么分配规划保证利用率最高、算力最大化利用也很重要。推理模型根据参数量进行估算如Qwen3-32B最低2张卡条件允许的话可以4张卡及以上推理的速度会更快一些当然Qwen3-72B参数规模就得8张卡了算力太低的话大模型根本跑不起来。如下是我们之前一个项目的GPU规划表可以参考模型规划卡数量Qwen3-32B2张卡Qwen2.5-VL-32B2张卡文生视频1张卡文生图1张卡图生文1张卡视频转文字1张卡语音合成0张卡轻量化模型只用cpu或者模型规划卡数量Qwen3-32B3张卡文生视频1张卡文生图1张卡图生文1张卡视频转文字1张卡语音合成1张卡或者条件允许的情况下把推理大模型跟多模态大模型分开部署推理模型使用4-6张卡多模态大模型每个小模型使用2张卡充分利用算力把性能提上去利益最大化。参与的过往的项目中使用的多模态大模型主要有文生图Qwen/Qwen-Image、图生文Qwen/Qwen2.5-VL-7B-Instruct、文图生视频Wan-AI/Wan2.2-TI2V-5B、视频转文字Whisper-large-v3、语音合成模型(文本转语音)IndexTTS-2推理大模型使用Qwen3-32B大模型。当然Qwen72B参数大模型需要的配置更高。参考最低配置如下设备编号配置部署模型模型类型所需 NPU 卡数设备 1规格4U机架式服务器2、CPU配置4颗HUAWEI Kunpeng 920 5250单颗物理核数48核主频2.6GHz3、内存配置8*64GB4、硬盘配置2块480GB SATA SSD系统盘5块3.84TB NVME SSD数据盘raid卡SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache5、NPU卡配置8*Ascend 910B 64G-HCCS6、物理网卡1*4*25GE(业务网4张 8*200GRCEE V2参数网7、电源配置4*2600W白金交流电源22冗余910B芯片 320TFLOPS FP16640TOPS INT8 显存为64GB HBM2e显存带宽400GB/s)Qwen2.5-72B-Instruct172B 大模型4 卡RYS-Llama3.1-Large等效 72B 大模型4 卡设备 2规格4U机架式服务器2、CPU配置4颗HUAWEI Kunpeng 920 5250单颗物理核数48核主频2.6GHz3、内存配置8*64GB4、硬盘配置2块480GB SATA SSD系统盘5块3.84TB NVME SSD数据盘raid卡SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache5、NPU卡配置8*Ascend 910B 64G-HCCS6、物理网卡1*4*25GE(业务网4张 8*200GRCEE V2参数网7、电源配置4*2600W白金交流电源22冗余910B芯片 320TFLOPS FP16640TOPS INT8 显存为64GB HBM2e显存带宽400GB/s)Mistral-Large-Instruct-2407等效 72B 大模型4 卡Smaug-72B72B 大模型4 卡设备 3规格4U机架式服务器2、CPU配置4颗HUAWEI Kunpeng 920 5250单颗物理核数48核主频2.6GHz3、内存配置8*64GB4、硬盘配置2块480GB SATA SSD系统盘5块3.84TB NVME SSD数据盘raid卡SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache5、NPU卡配置12*Ascend 910B 64G-HCCS6、物理网卡1*4*25GE(业务网4张 8*200GRCEE V2参数网7、电源配置4*2600W白金交流电源22冗余910B芯片 320TFLOPS FP16640TOPS INT8 显存为64GB HBM2e显存带宽400GB/s)Qwen2.5-VL-7B-Instruct7B 视觉模型2 卡ModelTC/Qwen-Image-Lightningfunasr轻量视觉模型2 卡InternVL 14B视觉大模型2 卡Wan2.2-TI2V-5B跨模态模型2 卡大模型平台Whisper-large-v3语音识别翻译模型(视频转文本)2 卡IndexTTS-2语音合成模型(文本转语音)2 卡条件允许不差钱的情况下推荐配置如下设备编号配置部署模型模型类型所需 NPU 卡数设备 1规格4U机架式服务器2、CPU配置4颗HUAWEI Kunpeng 920 5250单颗物理核数48核主频2.6GHz3、内存配置16*64GB4、硬盘配置2块480GB SATA SSD系统盘5块3.84TB NVME SSD数据盘raid卡SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache5、NPU卡配置8*Ascend 910B 64G-HCCS6、物理网卡1*4*25GE(业务网4张 8*200GRCEE V2参数网7、电源配置4*2600W白金交流电源22冗余910B芯片 320TFLOPS FP16640TOPS INT8 显存为64GB HBM2e显存带宽400GB/s)Qwen2.5-72B-Instruct172B 大模型8 卡设备 2规格4U机架式服务器2、CPU配置4颗HUAWEI Kunpeng 920 5250单颗物理核数48核主频2.6GHz3、内存配置16*64GB4、硬盘配置2块480GB SATA SSD系统盘5块3.84TB NVME SSD数据盘raid卡SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache5、NPU卡配置8*Ascend 910B 64G-HCCS6、物理网卡1*4*25GE(业务网4张 8*200GRCEE V2参数网7、电源配置4*2600W白金交流电源22冗余910B芯片 320TFLOPS FP16640TOPS INT8 显存为64GB HBM2e显存带宽400GB/s)RYS-Llama3.1-Large等效 72B 大模型8 卡设备 3规格4U机架式服务器2、CPU配置4颗HUAWEI Kunpeng 920 5250单颗物理核数48核主频2.6GHz3、内存配置16*64GB4、硬盘配置2块480GB SATA SSD系统盘5块3.84TB NVME SSD数据盘raid卡SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache5、NPU卡配置8*Ascend 910B 64G-HCCS6、物理网卡1*4*25GE(业务网4张 8*200GRCEE V2参数网7、电源配置4*2600W白金交流电源22冗余910B芯片 320TFLOPS FP16640TOPS INT8 显存为64GB HBM2e显存带宽400GB/s)Mistral-Large-Instruct-2407等效 72B 大模型8 卡设备 4规格4U机架式服务器2、CPU配置4颗HUAWEI Kunpeng 920 5250单颗物理核数48核主频2.6GHz3、内存配置16*64GB4、硬盘配置2块480GB SATA SSD系统盘5块3.84TB NVME SSD数据盘raid卡SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache5、NPU卡配置8*Ascend 910B 64G-HCCS6、物理网卡1*4*25GE(业务网4张 8*200GRCEE V2参数网7、电源配置4*2600W白金交流电源22冗余910B芯片 320TFLOPS FP16640TOPS INT8 显存为64GB HBM2e显存带宽400GB/s)Smaug-72B72B 大模型8 卡设备 5规格4U机架式服务器2、CPU配置2颗HUAWEI Kunpeng 920 5250单颗物理核数48核主频2.6GHz3、内存配置16*64GB4、硬盘配置2块480GB SATA SSD系统盘5块3.84TB NVME SSD数据盘raid卡SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache5、NPU卡配置4*Ascend 910B 64G-HCCS6、物理网卡1*4*25GE(业务网4张 8*200GRCEE V2参数网7、电源配置4*2600W白金交流电源22冗余910B芯片 320TFLOPS FP16640TOPS INT8 显存为64GB HBM2e显存带宽400GB/s)Qwen2.5-VL-7B-Instruct7B 视觉模型2 卡ModelTC/Qwen-Image-Lightningfunasr轻量视觉模型2 卡大模型平台设备 6规格4U机架式服务器2、CPU配置4颗HUAWEI Kunpeng 920 5250单颗物理核数48核主频2.6GHz3、内存配置16*64GB4、硬盘配置2块480GB SATA SSD系统盘5块3.84TB NVME SSD数据盘raid卡SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache5、NPU卡配置16*Ascend 910B 64G-HCCS6、物理网卡1*4*25GE(业务网4张 8*200GRCEE V2参数网7、电源配置4*2600W白金交流电源22冗余910B芯片 320TFLOPS FP16640TOPS INT8 显存为64GB HBM2e显存带宽400GB/s)InternVL 14B视觉大模型4 卡Wan2.2-TI2V-5B跨模态模型4 卡Whisper-large-v3语音识别翻译模型(视频转文本)4 卡IndexTTS-2语音合成模型(文本转语音)4 卡经济条件一般的企业可以选择有些轻量级的多模态模型使用CPU卡不用GPU节省开支当然了推理大模型、推理服务器模型的参数和算力硬件方面要重点关注考虑、重点加大投入了保证项目使用方用户体验。
返回列表