热学这门课,放在【信息科学与工程学】和【物理/化学工程技术】的知识体系里,很多人第一反应是“毕业这么多年了还要碰热力学?”但你只要拆过机、跑过满载测试、给CPU换过硅脂,或者被服务器机房的“发烧”折腾到彻夜排查,就会明白热学压根不是选修课,而是绝大多数硬件与工程项目的必修课。作为知识体系系列的第四篇,这篇我不想复述教科书,而是想聊聊热学里真正决定工程成败的那些东西:温度、热量、热力学定律、三大传热方式、相变与循环,以及从芯片TDP到散热器选型的完整计算路径。无论你是做电子散热、机械结构、自动化控制、电池电源,还是单纯想搞明白设备为什么“烫”和怎么才能让它凉下来,这篇都应该能对得上。
1. 热学知识体系怎么搭:先抓住热力学和传热学这两条主线
1.1 宏观热力学和传递过程,到底各管哪一段
我刚开始接触热学时最困惑的就是一件事:热力学和传热学到底有什么区别,为什么学校里要分两门课教?后来在实际项目里被现实教育过几次才明白,这两条线分别回答的是两个完全不同的问题。
热力学管的是“方向、上限和能量账”。它研究平衡态,告诉你热能不能从低温物体自发流到高温物体,告诉你一台热机最高能有多少效率,告诉你在一个闭环系统里能量收支必须平衡。它不关心这个过程需要多长时间,就好像财务只关心账平不平,不关心钱从A账户转到B账户到底用了几秒。
传热学管的是“速率和路径”。它研究的是热量具体怎么流、流多快、沿途受到多少阻力。傅里叶定律、牛顿冷却公式、热对流和热辐射计算都在这一条线上。这更像是物流公司该关心的事:货要在什么时候送到、走哪条路线、途中有没有堵点。所以你会发现,一个芯片功耗125W,热力学告诉你这125W不可能凭空消失,传热学才告诉你该用多大的散热器、配多大的风量才能把这125W稳定送到环境空气里去。
工程失败的案例里,绝大多数不是“总能量算错了”,而是“传递速率没跟上”。散热器有足够大的体积但翅片间距布局不合理,风量看着很足但静压上不去,热从一个点源传到了整个外壳却散不出去,这些都是速率问题,不是能量账的问题。所以搭知识体系的时候,我建议各位先把“热力学管账、传热学管货”这个区分刻在脑子里,后面所有公式和参数都往这两个筐里放。
另外一个容易被忽视的基础是热力学第零定律。它说如果A和C达到热平衡,B和C也达到热平衡,那么A和B一定处于热平衡。这句话听着像废话,但它就是所有温度测量的存在依据。你拿热像仪、热电偶读到的温度,本质上都是基于第零定律建立的“温度标尺”。没有它,工程上所有温度读数都没有公信力。
1.2 为什么信息工程师和工程技术岗都要专门补这门课
先说最现实的原因:功耗密度起来了。芯片工艺越先进,单位面积上的发热量反而越难处理,因为漏电流增大、开关频率提升、晶体管密度还在涨。CPU和GPU的TDP从65W一路走到125W、250W甚至更高,服务器单机柜功率密度已经动不动就超过10kW。信息工程的同学如果只懂代码和电路,不管热耗散,设计出来的板子和机箱大概率只能靠降频硬撑,用户实际体验就是“跑分很高,满载三分钟就掉速”。
热学对整个工程技术领域的渗透比表面上看起来要深得多。做LED灯具的,要算结温和光衰寿命,因为每升高10°C,LED寿命可能缩水一半以上;做电池包的,要知道热失控的连锁过程,充电倍率过高时电芯内部升温曲线比任何数据都关键;做电机驱动的,要算IGBT模块的壳温和结温,散热器设计不合理的话,同一套驱动方案在不同环境下表现天差地别。这些统统离不开热学的基础概念。
从信息科学的软件视角看,热学还提供了性能管理的重要约束。现代CPU、GPU都有温度墙和功耗墙,操作系统和调度器要在允许的温度范围内尽量拉高频率。这就意味着,一个软件工程师如果不理解“温度-频率-功耗”之间的耦合关系,就很难理解为什么同样的算法在笔记本上会卡顿、在台式机上却流畅。散热能力直接决定了产品能跑多快,这是很多纯软件背景的人非常容易忽略的变量。
至于物理化学方向的工程技术岗,热学就更核心了。热膨胀系数影响材料匹配,相变潜热决定散热和蓄能系统的设计,热分析是材料研发、化工过程、能源动力绕不开的工具。可以说,热学是连接“物理化学基础理论”和“信息工程落地产品”之间的一座桥,桥不通,两边都走不远。
2. 七个核心概念和关键参数,工程计算全靠它们
2.1 温度和热量根本不是一回事,别再混着用
我一直觉得工程上的很多低级错误,都源于把温度和热量当成同一个东西。温度是状态量,它描述的是物体内部微观粒子平均动能的强弱;热量是过程量,它描述的是因为温差而发生的那部分能量转移。一块冰和一杯冰水温度都能是0°C,但它们的“热含量”完全不同,融化时吸收的热量也完全不同。
比热容这个概念就是用来描述“储存热量能力”的。定义很简单:单位质量的物质温度升高1°C需要吸收多少热量,公式是c = Q / (m·ΔT)。水的比热容约4200 J/(kg·°C),铜约385 J/(kg·°C),铝约880 J/(kg·°C)。所以说满壶水冰得慢、热得也慢,而散热片几秒钟就能热起来,本质上就是“热容”差异在起作用。
工程上还有一个很实用的引申概念叫热时间常数,可以类比RC电路里的时间常数。散热系统的温升不是瞬间完成的,而是按指数曲线爬升。系统的热容越大、散热热阻越大,达到稳态的时间就越长。这个参数在做瞬态测试、开机过温保护、短时峰值功耗设计时特别重要。比如某个设备只需要跑30秒满载,那完全可以利用热容“扛”过去,散热器不用按持续功耗设计。但如果设计者不懂这个概念,只会按稳态最大功耗一股脑加散热器,成本、体积、重量都会失控。
我做测试时经常看到有人把“摸上去很热”等同于“温度已经到稳定了”,其实物体还在热惯性爬升阶段。要判断是否到稳态,标准做法是连续两次读数变化小于某个阈值,比如一分钟内变化不超过0.5°C才算稳定。这个习惯一旦养成,能省掉大量无效数据。
2.2 热力学三定律的人话版本与工程边界
热力学三定律在课本里写得又长又抽象,但落到工程上其实可以压缩成四句话。
第零定律刚才提过,是温度测量的基础。第一定律就是能量守恒:系统内能的变化等于吸收的热量减去对外做的功,ΔU = Q - W。这条在工程上等效于“发热、做功、储能三者必须对得上账”。一个电机发热严重,要么是输入功率真的高,要么是输出机械功没做到位,要么是热容在吸收热量导致温度持续上升。第一定律给你一个排查思路:先看能量收支有没有缺口。
第二定律最常被工程人员忽略,但它决定了所有散热和制冷系统的效率天花板。热不可能自发地从低温物体传到高温物体,所以要实现制冷就必须消耗外界功。这就直接推导出卡诺效率上限:热机效率最高到1 - Tc/Th,制冷机的能效比最高到Tc/(Th - Tc)。单位是开尔文绝对温度。这句话一旦看懂了,你就明白为什么数据中心要拼命降低冷却水的温度、为什么热泵在温差小的工况下特别省电、为什么半导体制冷片的COP那么难看还不是工艺问题,而是物理上限摆在那里。
第三定律说的是绝对零度永远达不到,它对大多数常规工程场景只是“存在感”而已,但在低温工程、航天热控和量子计算里会变成硬约束。温度差越小,越接近0K时,哪怕是极其微小的漏热也可能产生巨大影响。
每一条定律在工程里都不是摆设。尤其是第二定律的极限意识,能帮你快速判断一个方案是否值得投入:如果某个制冷方案的COP理论上限只有2.0,实际能做到1.5就算优秀了,那你还幻想做到5.0,说明设计目标本身就不现实,趁早换路线。
2.3 工程热物性参数速查:导热系数、热阻、热容怎么选怎么看
做热设计的人工位上,应该长年贴着一张热物性参数表。我不主张背数据,但几个常用参数的意义和数量级必须心里有数。
导热系数(热导率)的单位是W/(m·K),它描述的是材料在单位温度梯度下传导热流的能力。银大约410、铜大约385、纯铝大约237、铝合金常见在120到180之间,钢大约50,水0.6左右,静止空气只有0.026左右。看到空气这个数字你就明白,为什么散热器要做得又大又薄,为什么热界面材料必须填满缝隙,为什么真空环境里的设备极其容易过热——空气本来是热的不良导体,抽成真空之后连这唯一的路也断了。
热阻这个概念更偏工程,单位是°C/W。它表示单位热流导致的温差,可以按R = L / (k·A)来估算一块平板导热的阻力。这里L是厚度,A是截面积。这个公式特别直观:想降低热阻,要么用导热系数更高的材料,要么减小厚度,要么增大接触面积。铜的导热系数是铝的1.6倍左右,但密度和成本也高很多,所以实际散热器用铝、热管用铜、热界面材料用硅脂的组合非常常见。
热膨胀系数(CTE)在工程配合里同样关键,单位是ppm/°C。铝大概23、铜大概17、陶瓷基板大概6到8、硅大概2.6。芯片直接焊在铜基板上,热膨胀失配会导致焊点疲劳和开裂,所以中间必须加缓冲层或选匹配的基板材料。我在功率模组项目里吃过这个亏,单纯关注导热系数选了厚铜板,结果热循环几百次后焊点出现细微裂纹,最终导致间歇性失效,排查了大半个月。
对流换热系数h也是个高频参数,单位是W/(m²·K)。自然空气对流大约5到25,强制风冷大约25到250,液冷可以达到1000以上,沸腾和冷凝换热更高,能到5000甚至100000。这个系数的跨度大得吓人,也决定了你从风冷换到液冷,同温差下的散热能力能提升一个数量级以上。
3. 三大传递方式的工程实践:导、对、辐怎么算怎么用
3.1 导热:从傅里叶定律到整条散热热阻链
导热是最基础的传热方式,宏观上遵循傅里叶定律。稳态一维情况下,导热量Q = k·A·ΔT / L。你把k看成材料的“通行能力”,A看成“车道宽度”,ΔT看成“压差”,L看成“路程长度”,这就和电流通过导体的逻辑一模一样。所以工程上干脆把热阻、热流、温差直接类比成电阻、电流、电压。热阻串联相加,这个性质可以让你把一条散热路径拆成好几段来逐段优化。
芯片散热路径实际上就是一条长长的热阻链:芯片结到外壳、外壳到热界面材料、热界面材料到散热器底座、散热器底座到翅片、翅片到空气。我见过很多人只盯着散热器选型,却忽略了封装内部和TIM的热阻。举个例子,一颗封装热阻Rjc就有0.1到0.2°C/W,如果整机目标热阻只有0.4°C/W,光封装和硅脂就吃掉一半预算,剩下散热器部分必须做到非常极限。
接触热阻是工程里最阴险的变量。两个固体表面看着贴合,微观上只有少数凸点真正接触,其余缝隙都是空气。前面提过空气导热系数只有0.026,几乎等于保温材料,所以如果螺丝压力不够、表面粗糙度不达标,接触面的热阻可能比你预期的高好几倍。我建议所有高功率项目都别跳过热界面材料验证这一步,直接拿热电偶测跨接触面的温差,差个5到10°C都是常事。
在材料选择上,散热底座普遍用铜或铝。铜导热好但密度大、价格高,铝合金便宜轻便但导热稍弱。折中方案是铝翅片插铜底、或者热管把热量快速带到铝翅片远端。热管的作用类似于“热量的超导体”,后面相变部分会专门讲。
3.2 对流:自然对流和强制对流的风道设计差异
对流换热的工程计算主要靠牛顿冷却公式:Q = h·A·ΔT。h就是传热学里那个对流换热系数,它不是一个常数,而是受流速、流体性质、表面几何形状、流动状态共同影响的经验参数。这也是热设计里很难精确手算的部分,所以业界普遍依赖仿真和经验公式,但数量级感受是可以建立的。
自然对流靠浮力,热空气上升、冷空气补充。它的特点是安静、无功耗、无活动部件,但换热系数很低,一般只有5到10左右。自然对流散热器翅片间距不能太密,太密了横向热空气很难上升,反而变成一个个“烟囱”之间的摩擦阻力。常见经验是自然对流的翅片间距要留得比强制风冷更大,而且必须保证下方有进风、上方有出风的空间。LED吸顶灯、无风扇工控机、家用路由器基本都是这个路子。
强制对流靠风扇或泵来强迫流体运动。风冷散热器的h可以做到25到250,远高于自然对流,代价是噪声、功耗、积灰和维护。风扇选择上有个经典指标组合:风量CFM和静压Pa。很多人只看风量,以为风量越大越猛,但实际风扇是否有效取决于它能不能克服系统的流阻。散热器翅片越密、风道转折越多、防尘网越厚,需要的静压就越高。同一台风扇装在开放环境和装在密集翅片散热器上,实际风量可能差出30%以上。
风扇的工作点必须通过风扇的PQ曲线和系统阻抗曲线的交点来确定,仿真或者风扇供应商的数据表能帮你算。经验教训是,不要留太多余量把风扇选得过猛,噪声指标机箱根本压不住;也不要卡着极限选,进风口阻塞之后风量会像跳水一样往下掉。最好是在样品阶段用风速仪实测散热器入口风速,再结合温升数据决定最终档位。
强制对流的风道设计比风扇本身更值得花时间。进出风口不能对着墙壁和线缆,热风不能回流到进风口,机柜前后通道要分开,服务器一般前冷后热。一个经典反面案例是:风扇排风能力很强,但出风口被一块挡板堵了一半,机箱内形成负压短路,冷风从缝隙直接漏到风扇附近,核心芯片反而吃不到风,温度直接失控。风道设计要靠“冷风从哪里进、经过哪个热源、从哪里出”整条路径来审查。
3.3 辐射:四次方关系的威力,以及什么时候必须算它
辐射传热不太符合普通人的直觉,因为它在常见温度下散发的那点热量看起来很小,但它遵循的是斯特藩-玻尔兹曼定律:辐射功率P = ε·σ·A·(T1⁴ - T2⁴)。这里σ是常数5.67×10⁻⁸,ε是发射率,T必须用开尔文绝对温度。四次方关系意味着温度对辐射能力的影响是指数级的,而不是线性级。
工程上有个判断标准:什么时候必须认真考虑辐射?第一,表面温度远高于环境温度的时候,比如加热炉、灯具、功率电阻;第二,其他传热路径被阻断的时候,比如真空环境,卫星散热几乎全靠辐射;第三,设备在封闭机箱内依赖表面自然散热的时候,外壳到环境空气的对流很弱,辐射反而可能成为主力。
发射率ε是一个经常用错的值。抛光金属表面ε可能只有0.02到0.05,几乎是辐射的镜子,表面温度看着不高但热就是散不出去。阳极氧化铝、喷砂表面、涂黑漆的散热器ε能到0.8左右。这也是为什么很多散热器要做黑色阳极氧化或表面涂覆,不只是好看,更是为了增强辐射。
我随手算过一个小例子:一块0.02平方米的平板,表面温度45°C,环境25°C,发射率0.9,辐射散热量大约2.4W。在几十瓦的自然散热设备里,这块板周围可能还有别的发热元件,辐射传热占比很可观。红外热像仪的原理也与辐射密切相关:它接收物体表面发射的红外辐射来反演温度,但如果被测表面的发射率设置不对,读数会严重偏离真实温度。抛光金属表面在热像仪里经常显示“冰凉”,就是因为发射率太低,测到的主要是环境反射辐射。
4. 热力学过程、相变与循环:从图表到热管、制冷系统
4.1 四条典型过程线怎么读,P-V图比公式更直观
热力学过程这块,建议别陷进公式里,先把P-V图看明白。等温过程在P-V图上是一条双曲线,等压过程是水平线,等容过程是竖直线,绝热过程是一条比等温线更陡的曲线。它们的共同规则只有一条:理想气体状态方程PV=nRT和内能变化ΔU = Q - W。
工程上最有用的是绝热过程。绝热压缩时外界对气体做功,气体温度升高;绝热膨胀时气体对外做功,温度降低。空压机连续压缩空气之后气缸和管路非常烫,就是这个机理;制冷循环里冷媒从节流阀出来后温度骤降,也是类似的降压膨胀。
等温过程虽然理想化,但它是设计参考的骨架。卡诺循环就是两个等温过程加两个绝热过程组成的理想循环,效率只取决于高温热源和低温热源的温度。这个循环实际造不出来,但它给了你一个绝对上限:任何真实热机都不可能比同温界下的卡诺机更高效。所以当你设计一个利用废热发电的方案时,先算一下卡诺效率上限,如果上限都不到10%,那这套方案大概率经济上不成立。
P-V图的另一个工程价值是压焓图在制冷系统中的应用。制冷工程里常用压焓图而不是P-V图,因为它能直观显示冷媒在压缩机、冷凝器、节流阀、蒸发器四个部件之间经历的状态变化和能量转移。做空调、热泵、冷柜设计的人必须熟练这一套图,这里先留个意识,后面实际项目用到时再对照着学效率高很多。
4.2 相变潜热与热管均温板:为什么温度能固在沸点附近
相变是我个人觉得热学里最“划算”的一部分,因为潜热的数值通常大得惊人。水的汽化潜热大约2257kJ/kg,而把1kg水从0°C加热到100°C只需要约420kJ,也就是说汽化能带走的热量,是把水从冰点烧到沸腾所需热量的五倍还多。这就是为什么汗液蒸发能带走那么多体热,也是为什么两相冷却系统能承载极高的热流密度。
热管的工作原理就是巧妙利用相变潜热。热管的蒸发段接触热源,管内工质受热汽化,蒸汽在微小压差驱动下快速流向冷凝段,在冷凝段放出潜热凝结成液体,液体再通过毛细结构或重力回流到蒸发段。由于潜热巨大,整个过程可以搬运非常多的热量,而且热管表面温度几乎均匀,所以等效导热系数远高于任何实心金属。一根直径8mm的热管,等效导热能力可能比同直径铜棒高出几十倍甚至上百倍。
均温板就是热管的扁平方形版本,作用是把一点上的高密度热流迅速铺开到整个平板表面,再交给后续的翅片和风扇。GPU、CPU的散热器上都有它。使用热管和均温板时要注意:方向性会影响性能,重力辅助回流的热管在倒装时效率会下降很多;毛细结构热管虽然不依赖重力,但对抗重力时性能会打折;此外,热管存在启动温度,小温差工况下可能不能正常工作。
相变材料(PCM)也值得一提。它通过熔化吸热来“吸收”瞬态热冲击,比如在电子设备短时高负载时,把热先储存起来,等负载降低后再慢慢释放。这种方案适合不需要持续散热、只需要把峰值温度压住的场景,比如便携设备、电动工具电池包。
4.3 热机效率与制冷循环,能效天花板怎么算
热机是把热能转化为机械功的装置,内燃机、蒸汽轮机都是。卡诺效率η = 1 - Tc/Th是效率天花板。比如蒸汽从500K向300K环境排热,理论上限η=1-300/500=40%,实际还要打对折,能到25%就相当不错了。这个认知能帮你避免对“废热发电”“温差发电”等项目抱不切实际的期待。
制冷循环是热机的逆向运行,用外界功把热量从低温物体搬向高温环境。衡量它的指标是COP,定义是制冷量除以输入功率。理想情况下,制冷COP上限是Tc/(Th-Tc)。室温25°C的空调从7°C的冷媒吸热,也就是Th≈298K、Tc≈280K,理论上限COP约15.6。实际压缩式空调能做到COP 3到5已经属于优秀,因为压缩机效率、节流损失、换热温差都在损耗。看到这里你应该明白,想要更省电,核心不是提高压缩机功率,而是减小换热温差,比如提高蒸发温度、降低冷凝温度。
压缩式制冷系统的四个核心部件极简版是这样的:压缩机把冷媒蒸气压缩成高温高压气体,冷凝器把它冷却成高压液体并放出热量,节流阀让高压液体降压变成低温低压两相状态,蒸发器让冷媒吸热蒸发成低压蒸气。这四步走完一个循环,热量就成功从冷端搬到了热端。整套系统的设计重心全在换热器的风量、冷媒充注量和流道压降上。
半导体帕尔贴制冷则是另一种思路:通过直流电流让热量从一端搬到另一端。它没有运动部件、体积小,但COP极低,通常只有0.3到0.7,而且热端散热处理不好会导致整个模块效率崩溃。它适合用在小功率精密控温场景,比如激光器、传感器、冷杯,不适合做大型散热主力。曾经有厂商想用半导体制冷片给CPU散热,最终都被功耗和热端风扇的吵声劝退了。
5. 从TDP到整机散热:一次完整的热设计计算
5.1 热阻链拆解:用公式直接算出散热器目标
热设计的起点不是选散热器,而是先定目标。我通常按这么几步走:拿到发热源的功耗P、允许的最高工作温度Tj、设备所处的工作环境温度Ta,然后算出系统总热阻Rja = (Tj - Ta) / P,单位°C/W。
举个实际例子。一颗CPU TDP标称125W,官方允许结温95°C,环境温度按35°C设计。那么整机允许热阻Rja = (95-35)/125 = 0.48°C/W。这个数字意味着从芯片结到空气之间的全部热阻加起来必须小于0.48°C/W。接下来拆解热阻链:封装内部Rjc一般0.1到0.2,TIM接触热阻Rcs大约0.05到0.15,剩下留给散热器的Rsa必须做到0.2到0.3左右。一款优秀的风冷散热器Rsa在0.3到0.5范围,液冷可以压到0.15到0.25。所以你会发现,95°C、35°C、125W这套组合下,风冷有点勉强,水冷更稳妥;如果把环境温度改到45°C,总热阻预算瞬间降到0.4°C/W,风冷基本可以出局了。
设计时要做的另一个判断是散热面积需求。给定散热器到空气的换热系数h约100 W/(m²·K),表面到空气的温差大概25°C,每个平方米的散热能力就是Q = h·A·ΔT = 100×1×25 = 2500W,听起来很猛。但现实中翅片效率不可能100%,翅片根部到顶部存在温度梯度,加上气流分布不均,实际有效散热能力往往只有理想值的50%到70%。这也是仿真和实测必须介入的原因。
热阻链拆解最大的价值是能找出“木桶短板”。如果实测整机散热已经到极限,你先量每段温差,哪一段温差最大就说明哪里热阻最集中。我之前遇到一个项目,芯片结温始终压不下来,按热阻链一拆,发现TIM厚了,重新调整装配工艺和压力后温度直接降了8°C,比换散热器效果好得多。
5.2 CFD仿真和实验验证,别让数据骗了你
热仿真软件,不管叫Flotherm、Icepak还是Fluent,底层思路都差不多:建几何模型、设材料、设热源功耗、设风扇曲线和边界环境、划网格、迭代求解流动和能量方程,最后输出温度流场。仿真最大的价值在于设计早期快速对比方案,比如换个风扇、改个翅片密度、调整风道布局,可以低成本筛选方向,而不是等开模之后翻车。
但仿真结果不能直接当真。习惯性的坑有三个。第一,网格不够密导致热点温度被抹平,芯片这种小面积高功耗热源甚至可以用POD散掉;第二,边界条件拍脑袋,风扇不给PQ曲线就用恒定流速代替,接触热阻直接设为零,这些都会导致仿真温度低于实际;第三,自然对流场景没开重力模型或者没算辐射,结果自然偏差。我做项目时有个铁律:仿真的目的不是逼真复刻实测,而是用于相对比较和趋势判断,安全起见在关键器件上多留5到10°C的工程余量。
仿真比较理想的流程是:先用理论手算热阻链确定可行方向,再用仿真软件做细化对比,确定风扇参数和散热器尺寸,最后打样实测验证。这一步叫“理论-仿真-实测”三层验证法。实测数据回来之后,把仿真模型标定一遍,让仿真温度和实测温度接近,之后再做下个改版时仿真精度会高很多。
测试验证也有自己的坑。热电偶粘贴位置不对、胶水太多、引线太长,都会测出偏低温度;热像仪发射率没校准,读数可能偏差十几度;环境温度没有控制在稳定状态下,所有温差对比都没有意义。最稳妥的办法是热电偶和红外热像仪同时用,互相印证。
5.3 实测温升的流程要点和红外热像仪使用细节
温升测试流程看起来简单,跑负载看温度,但细节决定数据可用性。我的标准流程是:先做准备工作,清理接触面、涂抹适量导热硅脂、按规格扭矩锁紧螺丝;布置热电偶,测温点至少包括芯片外壳、散热器底座、翅片出风侧、环境参考点;利用软件让设备跑满负载,比如用Prime95压CPU、FurMark压GPU;持续运行30到60分钟,直到温度曲线进入稳定平台。
热电偶使用中有几个细节很容易翻车。K型热电偶精度够用但容易受电磁干扰,T型热电偶在低温段更稳定。热电偶线本身会导热,太粗的引线等于给测点接了一个散热通道,导致读数偏低,所以要用细线并且把引线紧贴被测面走一段再引出。硅胶或导热胶固定热电偶时要少量均匀,胶水本身是隔热层,糊一大坨测出来的肯定是胶水温度而不是表面温度。
红外热像仪使用时最大的操作误区是不调发射率。前面说过,抛光金属表面ε可能只有0.05,直接默认0.95去测,读出来的温度会明显低于真实值。两种应对办法:一是把被测表面用高发射率黑胶带或哑光黑漆处理,注意这些附加物本身会略微影响散热;二是通过接触测温法先标定,把一个已知真实温度的点对应到热像仪的发射率设置上。热像仪适合看温度分布趋势,要找热点、看板上的不均匀温差非常高效,但要说绝对温度精度,它不如贴片热电偶。
负载跑完后记得记录恢复曲线,散热能力的优劣不只体现在满载温度,还体现在撤载后的降温斜率。降温很快说明热阻低、热容小;温升快降温慢往往是热阻大或者热容大,两者需要不同处理策略。这些数据积累下来,对后续项目选型特别有用。
6. 热学设计常见翻车现场与排查经验
6.1 六个容易踩的热学计算坑
进入工程阶段,纯理论错误少见了,更多是细节执行层面的偏差。我挑六个最常见的坑列出来,每个都亲手遇到过:
第一个坑是用“材料的导热系数”替代“系统接触热阻”。芯片和散热器接触面不可能做到原子级平整,间隙里的空气就是隐形的保温层。设计时如果只按铜的385 W/(m·K)去算,不预留接触热阻,误差轻松翻倍。对策是设计初期就加上0.05到0.15°C/W的接触热阻预算,具体数值靠实验标定。
第二个坑是只看风扇风量CFM,不看静压Pa。一个标称200CFM的风扇如果静压只有0.5mmH₂O,装上密集翅片散热器后实际风量可能只剩60CFM。系统流阻曲线和风扇PQ曲线必须匹配,否则一切都是空转。选型时向供应商要PQ曲线,仿真的进出口压力差也要对得上。
第三个坑是自然对流当强制对流设计。有的工程师拿着自然对流散热器模拟强制风冷的h值去算,最后的散热面积整整差一个数量级。这两者适用的翅片间距、方向、高度约束都不一样,必须在项目需求阶段就明确散热方式,不能两头都想占。
第四个坑是高温高压场景忽略辐射。温度超过150°C以后辐射占比快速上升,如果设计里还只算对流,就会大幅低估散热能力。反过来,如果实际辐射通道被隔壁板子挡住了,设计又会剩很多余量,导致体积白白增加。
第五个坑是对TDP的理解太死板。TDP是“散热功耗设计参考”,不是实际最大功耗。如今的CPU和GPU瞬时功耗跑起来能比TDP高20%到50%,如果散热系统卡着TDP做余量,就等着看满载掉频吧。
第六个坑是忽略海拔和环境温度变化。高原地区空气密度低,强制风冷的散热能力会下降;夏天40°C环境下散热器入口温度偏高,总热阻预算直接被吃掉。如果产品要全球出货,环境温度上限必须按最恶劣工况定义,而不能只用25°C的实验室数据。
6.2 设备过热的系统排查步骤
排查过热问题的思路不是头痛医头,而是把整条热路切开来看。我分享一套比较通用的步骤:先用红外热像仪快速扫一遍整机,找到最热的区域和异常热点;然后在关键节点用热电偶精确测温度,至少三个点:热源外壳、散热器底座、散热器出风侧;根据测点温度和功耗,反推各段热阻;最后针对热阻异常的环节做整改。
举一个真实案例。朋友那边一台工控机开机半小时后CPU温度飙升到105°C然后降频,表面看CPU散热器风量正常,风扇转得飞快。我用热像仪一扫,发现散热器一半区域明显凉,另一半热得发烫,明显是热管失效或者接触不良的典型特征。拆开之后发现散热器底座和CPU之间的硅脂因为安装时压力不均,已经偏移了大半,只有一小块地方接触上,接触热阻高得离谱。重新涂抹硅脂并按对角线交叉锁紧螺丝之后,满载温度骤降20°C。这就是热阻链分段排查的价值。
还有一个经典问题是风道短路。风扇把冷风从进风口吸进来,结果机箱内部隔板位置不对,冷风根本没经过散热器就从旁边的缝隙直接被风扇抽走了。排查方法是在散热器前后的温度做对比:散热器入口和出口风温应该有明显提升,如果进出风温差很小,说明风量虽然大但没经过热源;如果是散热器底部烫、翅片中部却凉,问题多半在热管或接触热阻。
对于风冷散热器的气流问题,可以用一根细线或者烟雾笔观察风口附近气流路径。开孔位置、防尘网压降、线缆挡风,这些细节在仿真阶段很容易被忽略,但实际影响比想象中大得多。很多“换个大风扇就能解决”的问题,其实重新安排一下线缆走向就把温度降下去了,一分钱没多花。
6.3 热界面材料选择的实操建议
热界面材料(TIM)是这个行业里最容易被低估的东西。它填充在芯片和散热器之间,把接触界面的空气赶走,让热量顺畅过渡。常见的有导热硅脂、导热垫片、相变材料、液态金属,各有各的脾气。
导热硅脂最普及,优点是导热系数不错、成本低、能适应不同压力。但它怕厚,硅脂本身导热系数再高也就几W/(m·K),涂太厚就等于加了一层阻力。最佳厚度是“刚好填满微凹坑”的薄薄一层,多了纯属帮倒忙。硅脂还有泵出效应和老化问题,长时间高温热循环后可能出现干裂,需要定期维护或选更高品质的产品。
相变材料在温度升高到特定值后变成液态,能更好地填满界面间隙,适合反复装配的场景。它的性能和寿命通常比普通硅脂稳定,但价格也高一些。导热垫片方便拆卸,适合需要维修的设备,但导热系数一般不高,只适用于功率不太高或允许温度较高的场景。
液态金属导热系数很高,理论上能把“芯片到散热器”的接触热阻压到极低,很多发烧友和高端显卡用这个。但液态金属有导电性,一旦溢出流到PCB上,轻则短路保护,重则直接烧板。使用前要在芯片周围做防护,耐压绝缘胶或海绵垫圈都要准备好,操作经验不足的同学我建议还是先老实用硅脂。
最后提一个经常被忽视的影响因素:安装压力。同样的硅脂和接触面,四颗螺丝锁不匀速、扭矩不足、压力分布不均,接触热阻都会不一样。螺丝的规格决定最大压力,但安装工艺决定实际压力。有条件的项目建议做压力纸或者压力传感器标定一下,没有条件也至少做到对角线交替锁紧,确保芯片受力均匀。这一步不用花多少钱,但对温度的改善常常立竿见影。
我自己一路做热相关项目下来,最大的感受是热学是一门特别适合“先算后测”的学科。很多人一上来就换大散热器、加暴力风扇,最后温度改善很小还引进噪声和功耗问题。其实只要把热阻链拆开、把温度测准,找到大头在哪,往往一个很小的针对性改动就能解决问题。建议每个做硬件、做系统的工程师都准备一个热电偶和一张热物性参数速查表,新项目启动时先花十分钟把TDP、允许温度、环境温度、目标热阻这四件套填上去,方案的靠谱程度立刻上升一个台阶。