十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI数据中心供电升级:1300W/1600W大功率DC-DC转换器技术解析

AI数据中心供电升级:1300W/1600W大功率DC-DC转换器技术解析 GPU单卡功耗站上1000W之后数据中心配电那套老玩法彻底不够用了。之前大家习惯的12V母线在单机柜功率三五十千瓦的背景下电流大到吓人铜排和连接器都快成为“电暖器”了。行业里转向48V甚至高压直流母线已经是大势所趋而在这个架构转换的过程中藏在中间的那一级大功率DC-DC转换器反而是整个供电链路里最能体现技术水平、也最容易出问题的地方。Advanced Energy这次发布1300W和1600W两款超高效DC-DC转换器瞄准的就是这个最关键的中间级。这篇文章就来拆一下这个级别转换器背后的门道包括为什么这个功率段如此重要、效率是怎么一点点抠出来的以及你真正把这东西用进系统时要注意哪些教科书上不写的细节。1. 这种大功率DC-DC转换器到底解决什么问题1.1 数据中心供电架构的升级带来“中间级”需求先说背景。传统服务器的供电链路是市电AC经过UPS再经过服务器电源模块PSU转成12V然后12V直接给主板上各路DC-DC降压到CPU、内存、硬盘用的电压。这个架构在单颗CPU功耗一两百瓦的年代完全没问题12V母线电流虽然不小但用铜排和插针还是能扛住。但AI服务器是个完全不同的物种。一颗旗舰GPU功耗动辄六七百瓦整台8卡服务器功耗奔着七八千瓦去单机柜功率密度从原来的十几千瓦涨到几十千瓦甚至上百千瓦。如果还在用12V母线一套8卡服务器的主供电电流随便就是五六百安培主板上那一排排供电端子发热量、压降、连接器损耗都会变成大问题。于是架构升级几乎是必然的PSU先输出48V再用48V到12V的大功率DC-DC转换器通常叫中间母线转换器IBC把电压降下来甚至更激进的做法是直接48V供给GPU主板附近的负载点变换器。这个48V架构里面那个负责把48V降到12V的隔离DC-DC就是这次发布的主角。这类转换器有几个特点输入电压相对稳定36V到75V的典型范围输出固定12V功率大必须是隔离拓扑而且要具备并联能力这样多块模组才能拼出更高的总功率。1300W和1600W的定位正好对应一台AI服务器里2到3块模组拼出一路3500W到5000W的高功率输出或者两颗400W级别GPU的一整块主板供电。1.2 1300W与1600W为什么是分水岭很多人看到1300W、1600W这两个数字第一反应是“不就是功率大一点嘛”。实际不是。这个功率段意味着两个硬门槛。第一散热挑战完全不同。一个四分之一砖大小的模块体积大概就四十多立方厘米要在这个体积里处理1600W的功率就算效率做到96.5%也有56W的热量要散出去。一个60W级别的“热源”集中在不到半张信用卡的面积上功率密度非常夸张。散热设计稍有疏漏满载运行几十分钟后模块就会热关断。第二在这么高的功率下把效率做上去技术拐点非常明显。14V左右的输出往12V灌输出端电流超过130A次级同步整流管的导通损耗、变压器绕组的交流损耗、磁性元件损耗每一项都是硬骨头。所以这个功率段历来是电源厂商展示技术实力的分水岭能稳定量产1500W级别高功率密度转换器的厂商在全球范围也就那几家。另外从使用场景看1300W正好能覆盖两颗主流GPU单颗600W到650W的板级供电需求1600W则是对应未来更高功耗芯片的提前布局或者用于双路CPU主板、800G交换机这类高功率设备。这个功率段的跨度设计本质上是在提前卡位下一代AI硬件的供电需求。1.3 这个产品适合谁来关注如果你只是做普通服务器运维这类转换器通常不在你的“可更换部件”名单里但如果你是数据中心基础架构规划、服务器硬件设计、板级电源设计、或者大功率设备的选型采购这个东西就需要好好研究了。具体来说这几类人应该重点关注第一做AI服务器整机供电方案的硬件工程师你需要评估把多块1300W/1600W转换器并上之后整机效率、热设计、成本和可靠性能不能达到预期第二做机柜级配电方案的架构师48V架构里的中间级效率直接影响整个机柜的PUE第三做通信设备、工业大功率设备供电的工程师这类转换器同样适用于需要高可靠性的室外基站、储能变流器控制电源等场景。后面我讲的集成细节和调试经验主要也是围绕这几类场景展开的。2. 超高效从哪来一个DC-DC转换器的技术解剖2.1 拓扑选型LLC为什么是主流对于这种大功率、高降压比、输入范围相对有限的隔离DC-DC谐振变换器尤其是LLC拓扑已经成为事实上的行业标准。核心原因就是能在很宽的负载范围内实现原边开关管的零电压开通次级整流管也能实现零电流关断开关损耗被压到非常低。对比一下其他拓扑你就明白了。移相全桥PSFB也能做ZVS但次级存在一个输出滤波电感这个电感在低压大电流输出下的损耗非常大而且轻载效率不好看。正激、推挽这类硬开关拓扑在1300W这个功率级别基本不用考虑开关损耗太大频率也上不去磁性元件体积压不下来。LLC可以利用变压器漏感和谐振电感实现软开关磁性元件还能和变压器集成功率密度优势很明显。当然LLC也有它的短板宽输入范围下增益调节困难轻载时可能进入间歇导通模式导致输出电压纹波增大。但用于数据中心的这类转换器输入就是48V标称电源范围相对固定LLC就能扬长避短。这也是为什么你在市面上看到的高功率中间母线转换器绝大多数主拓扑就是LLC。对于1600W这种规格原边开关管的电流应力进一步加大有些设计会选择交错并联两路LLC相位相差180度工作。这样做的好处是输出电流纹波能互相抵消输出电容可以用得更小磁件的尺寸也能优化。代价是控制复杂度成倍上升每一路都要做均流和独立的闭环控制。2.2 器件与工艺GaN、同步整流和平面变压器拓扑定了之后效率就从器件和工艺里一点点抠出来。原边开关管方面高压GaN器件在近年的大功率DC-DC里渗透率越来越高。GaN相比传统硅MOSFET栅极电荷和输出电容都小得多开关速度更快死区时间可以压得更短这对LLC这种软开关拓扑非常友好。即便导通特性差别不大GaN在驱动损耗和死区损耗上的优势就足以让最后那一两个百分点的效率差显形。次级输出端更关键。12V输出、130A以上电流次级整流必须用同步整流也就是用导通电阻极低的MOSFET取代原来的肖特基二极管。二极管正向压降在低压大电流输出的场景下会吃掉太多效率同步整流管则可以把压降降到几毫伏的量级前提是同步整流的驱动时序要精准不然反而会引起体二极管导通损耗更大。变压器本身的设计也是重头戏。大功率转换器里低压大电流侧的绕组损耗很敏感传统漆包线绕制很难控制交流电阻和漏感一致性。现在主流方案是平面变压器用PCB绕组或者铜片叠压成型漏感一致性、散热路径和绕组层间分布电容都能被精确控制。我看到很多1600W级别的设计会直接用双副边绕组并联再把同步整流管直接贴装到变压器二次绕组旁边把高频环路的寄生电感压到最低。2.3 效率数字之外还应该看什么厂商宣传时通常会把“峰值效率”“典型效率”挂在嘴边但工程师选型的时候不能只看这些营销数字。你更要关注的是效率曲线上几个关键点的实际值。一是半载效率。数据中心服务器实际运行功率通常不会满载大部分时间落在40%到60%负载区间。如果一颗转换器在满载时效率很高但在半载时掉得厉害那在真实工况下整机效率反而不理想。二是5%到10%负载下的待机效率这个点决定了设备空闲时耗多少电。三是效率曲线的平坦程度优秀的转换器能做到从20%负载到满载效率曲线几乎拉平在95%以上。还有一个容易被忽略的指标是输出电压精度和瞬态响应。大功率设备的负载变化非常剧烈GPU任务调度时电流变化速率可以达到每微秒几安培。转换器如果环路设计得不好输出电压在瞬态瞬间掉出规格范围就可能引起GPU工作异常甚至重启。这个指标比效率更难做也更考验厂商的真实设计功底。3. 把转换器用到系统里的实操要点3.1 热设计风量、散热器和热阻计算拿到一颗1600W转换器效率就算按96.5%算满载也有56W热量需要散发。如果你直接把它平放在机箱里靠自然对流冷却模块表面温度会迅速飙升。这类转换器通常设计有基板使用时必须通过基板把热量传导到系统散热器或者机箱结构件上。实操中建议先做一次简单的热阻核算。转换器厂商会在规格书里给出基板到环境的热阻以及推荐的基板温度上限。假设要求基板温度不超过105°C环境温度55°C转换器最大损耗60W那你的散热系统热阻就必须低于105-55/600.83K/W。这通常意味着需要一只带风道设计的散热器加上一定风量的强制风冷。别指望自然对流能做到这个热阻值。还有一个细节经常被忽略散热器接触面的平整度和导热垫的选择。转换器基板和散热器之间如果不涂导热硅脂或不加导热垫热阻会大几倍。选择导热垫时注意它的压缩率压得太紧会把基板顶变形反而影响内部功率管的贴装应力。我见过一个项目因为导热垫选得太厚太硬模块满载跑了半小时后热关断排查了半天才发现是导热垫装配不均匀导致基板局部悬空。3.2 输入输出电容与远端采样模块规格书上给的输入输出电容只是最小推荐值实际系统设计时你通常需要额外加电容。输入侧要加足以应对输入电压瞬变的电解电容或聚合物电容功率越大这个电容就越重要。因为插入一个满载模块时输入电源的响应如果跟不上输入电压瞬间跌落模块可能直接进入欠压保护。输出侧建议在模块输出端就近放置几颗大容量低ESR的电容再加上高频陶瓷电容。1200W模块的负载瞬态响应很大程度上依赖输出电容的配置。陶瓷电容负责提供瞬态电流电解电容负责稳住长时间的低频扰动。只按规格书最小电容值来设计往往会在瞬态测试时栽跟头。远端采样也一定要接。1600W模块输出电流超过120A即使50cm的PCB走线压降也超过100mV不接远程检测端子的话负载端的实际电压会比模块内部反馈点低很多严重时负载端电压会跌破设备最低工作电压。正确的接法是差分走线把负载端电压引回模块的remote sense引脚并且采样线的走线要避开大电流路径和开关节点别和大电流输出线平行走太远。3.3 并联扩容与均流单块1600W还不够用怎么办并联。这几乎是所有大功率转换器绕不开的话题。并联扩容首要解决的是均流问题。理想情况下每一块并联的转换器输出同样比例的电流实际过程中由于器件差异、走线阻抗差异A模块可能多出力B模块轻松躺着时间长了A模块热老化加快。一般大功率转换器都内置有均流总线share bus模块之间通过一根均流线互相通信自动调节各自输出让电流分配均匀。实操时需要注意均流线的连接方式。均流线虽然是信号线但它参与均流控制接不好会引起系统振荡。尽量使用双绞线或者屏蔽线并且远离输出功率线。均流线最好像菊花链一样一段段接过去不要星形汇聚太多线否则容易引入额外干扰。并联之后整机的输出纹波会增加一些这也正常但如果你发现并联后纹波异常大优先检查均流线和模块控制地之间的连接很可能是地电位不一致造成的。3.4 时序和监控接口现代高端转换器都带PMBus或者I2C通信接口别把这组信号线当摆设。它不仅能帮你实时读取输入电压、输出电压、输出电流、模块温度、故障状态还能配置一些保护阈值和开关机时序。使用通信接口读取遥测可以发现很多用万用表看不出的问题。比如我从遥测数据里观察到某块模块的输入功率曲线有毛刺排查后发现是上游48V电源在某个负载点进入振荡模式。这种问题靠普通示波器很难抓到因为随机性很强但遥测数据把趋势记录下来之后问题就一目了然了。上电时序也要注意。多模块并联时建议通过EN引脚统一控制各模块的启停顺序。如果让模块自由上电在输入电压缓慢上升的条件下各模块的软启动可能存在差异输出端会出现短时间的倒灌电流对内部同步整流管不利。4. 1300W还是1600W选型、冗余与可靠性4.1 选型逻辑不是瓦数越大越好1300W和1600W相差300W看起来是20%的余量但选型真不只是“更大更稳”这么简单。功率选大了成本和体积都上去选小了系统在峰值负载时可能直接触发过流保护设备掉电这在数据中心属于事故级别的事件。合理的做法是先画出系统负载剖面。比如一台AI服务器GPU瞬时峰值功耗可能是1300W但常态运行可能只有1000W。这时候选1300W单模块就能撑住如果考虑后期GPU功耗版本升级选择1600W可以留出冗余空间代价是模块成本和热设计余量都要增加。另外要注意转换器的降额曲线。规格书里标注的1300W通常是特定冷却条件下的额定值如果系统风量不足或者环境温度偏高模块可能要降额到1100W甚至更低使用。选型时必须对照规格书的降额曲线确认在自己的系统散热条件下模块能持续稳定输出多少功率。忽略这一步很容易出现“标称1300W实际只能当1000W用”的尴尬局面。4.2 N1冗余怎么搭对可靠性要求高的系统N1冗余几乎是标配。比如一路负载需要1300W那就用两块1300W模块并联每块承担50%负载如果一路负载需要2600W就用三块1300W模块任何一块故障都不会导致系统掉电。冗余设计的关键在于故障隔离。并联系统中如果一块模块的输出级发生短路击穿不能把整条输出母线拉垮否则其他模块也白搭。所以每个模块的输出端都要加装合适的Oring电路或快熔保险丝故障模块能在微秒级时间内被隔离。还有一个容易被忽略的点冗余系统的输入侧也要做隔离。如果输入电源是单路48V那输入端的故障也意味着全系统断电。真正的冗余架构从输入配电、转换器、到输出母线每个环节都要考虑单点故障的可能性。这个层面就不是选一块模块的问题而是整个供电拓扑设计的问题了。4.3 可靠性数据怎么读厂商会提供MTBF数据但这个数字经常被误解。MTBF是统计意义上的平均无故障时间不等于单片模块实际能工作那么久。工程上更实用的指标是看模块在高温、高湿、大电流应力下的长期表现这通常只能通过厂商的可靠性测试报告和市场上的口碑来判断。从我几年的使用经验来看对于大功率转换器判断可靠性有几个侧面指标一是看模块的满载温度温度越低说明设计裕量越足二是看是否内置了完善的温度补偿和电流降额功能好的模块会主动根据温度调整限流点自我调节而不是简单粗暴地关断三是看保护功能是否细化比如是否区分过流、短路、过温、输入欠压等不同的故障码这对于系统排障非常重要。5. 调试与排障实际项目中的几个典型问题5.1 上电没输出先别急着拆模块第一次上电模块一点输出都没有很多人的第一反应是模块坏了直接换一片。但我经历的绝大多数情况是外部条件没满足。先用万用表确认输入电压是否真的到了模块的启动门槛。很多48V模块的启动电压不是正好48V有的需要44V以上就是启动但有的需要53V这个阈值不是标准统一的。输入电压在临界值时模块会表现为“偶尔能启动大多数时候没反应”非常容易误判。然后检查EN引脚。如果EN引脚被拉低模块是绝对不会输出的而有些系统设计里EN引脚是接到了某个控制芯片的GPIO芯片固件没跑起来GPIO默认输出低电平模块就沉默到底。这个坑在原型调试阶段特别常见排查时一定要先确认控制逻辑的状态。实在不行再看芯片的故障寄存器。前面说过PMBus接口会记录故障原因读一下故障码是所有排查手段里效率最高的。别上来就拆模块拆了也看不到内部细节还容易弄坏连接器。5.2 满载掉压和啸叫满载运行时输出电压往下掉通常有两个原因一是输出端压降太大远端采样没接好或采样走线噪声太大二是输入电压跌落模块已经进入限功率保护状态。有一回我调试一套1600W供电系统满载时输出电压从12.1V掉到11.7V怎么调环路的数字补偿参数都不见好转。后来用示波器同时看输入电压波形发现48V输入在满载瞬间跌到40V以下模块内部已经进入欠压保护窗口边缘输出自然稳不住。问题源头是上游48V电源本身功率不够而不是转换器本身有问题。啸叫问题的根源通常是磁性元件或陶瓷电容在特定频率下产生机械振动。大功率转换器在轻载时会进入间歇导通模式burst mode开关频率可能掉到音频范围内这时变压器和电感发出可听见的噪声。轻微啸叫在不影响性能的前提下可以接受但如果啸叫伴随着输出电压纹波剧烈波动就要检查是不是环路补偿参数设置得太激进导致控制在间歇模式和不间歇模式之间反复切换。5.3 并联不均流的排查并联系统最烦的问题就是均流不均。表现为某一块模块温度明显比别的高或者通信遥测里各模块输出电流差异很大。排查顺序建议是这样的先看均流线是否接对、接触是否可靠然后看各模块的输出走线阻抗是否一致。如果模块A离负载近、模块B离负载远B模块的走线阻抗大B模块的电流自然会偏小。解决方法是让并联模块的输出走线尽量对称必要时在每路输出端加装小电感来均衡回路阻抗。还有一个容易被忽视的因素模块之间地电位的差异。如果并联模块安装在不同位置结构件接地阻抗不一致模块控制地之间存在电压差均流总线上的微小电压都会被放大成功率差。遇到这种问题检查所有模块的信号地是否在单点可靠连接同时确保模块底部基板良好接地。5.4 通信接口连不上PMBus连不上多半不是你代码的问题而是电气层面的小错误。I2C总线需要上拉电阻很多模块不会把上拉电阻做进去需要系统主板上提供。如果没加上拉或者上拉电阻阻值太小总线会一直处于高电平或者信号边沿变形严重通信自然不稳定。地址冲突也是大功率模块并联时的常见坑。多块模块并联时每块模块需要不同的PMBus地址厂商一般会提供配置引脚来设置地址偏移。如果几块模块地址相同总线上的通信就会互相干扰表现为时好时坏、数据读到一半卡住。最后通信线的走线长度和布局要尽量克制。PMBus虽说是I2C但在大功率模块旁边开关噪声很强通信线走太远且没有屏蔽保护很容易出现数据错误。建议通信线走短线、加地线屏蔽必要时降低总线速率试试很多偶发的通信问题就消失了。最后分享一个小技巧调试这类大功率转换器我习惯在正式接负载之前先用电子负载做一次从10%到100%的阶梯负载扫描同时开着遥测记录一秒采一次输入功率、输出电压、模块温度和输出电流。这样既能验证模块在动态负载下的表现也能留一份完整的基线数据。以后设备在用户现场出了问题可以先对比基线数据快速判断是模块老化还是系统环境变化。这个习惯帮我在好几个项目里把几天的排障时间缩短到了几个小时值得一试。
返回列表