十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

56G PAM4 SerDes RX设计:32路交织SAR ADC架构与校准实战

56G PAM4 SerDes RX设计:32路交织SAR ADC架构与校准实战 1. 从56G PAM4 SerDes的RX架构说起为什么32路交织SAR ADC成了关键拼图56G PAM4 SerDes的接收端设计这两年成了高速接口领域最卷的赛道之一。PAM4把每个符号周期压缩到只剩不到20皮秒的UI单通道56Gbps的速率意味着奈奎斯特频率直接顶到14GHz。传统的Flash ADC在这个节点上功耗和面积都开始失控逐次逼近型SARADC凭借其数字友好的架构和优异的能效比成了RX采样前端的主流选择。但单路SAR的转换速率受限于逐次逼近的串行特性想跑到几十GS/s的采样率时间交织Time-Interleaving几乎是唯一出路。32路时间交织SAR ADC就是在这个背景下被推到台前的方案。它的核心思路很直接把一路超高速采样任务拆成32路低速SAR并行处理每路只需要工作在采样率的三十二分之一就能在整体上实现等效的超高采样率。听起来像是简单的“人多力量大”但真正做过的人都知道交织路数一多时钟偏斜、增益失配、失调失配这些问题会像滚雪球一样放大顶层设计和采样前端的每一个细节都会被放到显微镜下审视。这篇文章面向的是正在做或准备做56G PAM4 SerDes RX采样前端设计的工程师尤其是那些需要把SAR ADC阵列集成到SerDes接收链路里的朋友。我会从顶层架构的取舍讲起拆到采样前端的具体电路细节再聊时钟分配和校准这些容易踩坑的地方。内容基于我在实际项目中积累的经验和常见工程实践不是教科书式的原理复述而是尽量把“为什么这么做”和“怎么做才稳”讲清楚。2. 顶层架构的取舍32路交织到底怎么分、怎么合2.1 交织路数的确定不是拍脑袋32路这个数字不是随便选的。它背后是一组硬约束的平衡单路SAR的转换速率上限、采样时钟的可行频率、输入带宽的分配、以及功耗和面积的预算。假设目标采样率是56GS/s对应56G PAM4的单通道符号率32路交织意味着每路SAR的工作频率是1.75GS/s。这个频率对现代SAR来说是比较舒服的区间——既不会因为太快而导致比较器功耗飙升也不会因为太慢而让交织路数继续膨胀。如果选16路每路要跑到3.5GS/sSAR的逐次逼近周期被压得很紧比较器和DAC建立时间都会非常吃紧功耗反而可能更高。如果选64路每路只要875MS/s但时钟树的分支数翻倍偏斜校准的复杂度指数级上升输入采样网络的寄生电容也会大到难以接受。32路是一个在速度、功耗、复杂度三者之间的甜点位置。注意交织路数的选择一定要和你的工艺节点挂钩。在28nm以下工艺里32路是常见选择如果用的是更成熟的工艺单路SAR跑不快可能得考虑64路甚至更多但那时候校准的代价要提前算清楚。2.2 模拟前端与数字后处理的边界划分顶层设计里最容易扯皮的就是边界划分哪些事情交给模拟域做哪些交给数字域做。我的经验是采样前端尽量保持“干净”——只做采样和保持不做任何增益或失调的模拟修调。增益和失调的校准全部放到数字域用片上DSP或者后处理逻辑去补。这样做的好处是模拟前端的功耗和面积可以压到最低而且数字校准的精度和灵活性远高于模拟修调。具体来说每路SAR的采样开关后面直接接保持电容保持电容上的电压就是原始采样值。失调失配通过数字域的均值滤波或者LMS自适应算法来估计和补偿增益失配则通过检测每路输出的统计特性来归一化。模拟域唯一需要做的“额外”事情是提供一个稳定的参考电压和共模电平其他都交给数字。2.3 交织架构的两种主流拓扑32路交织SAR的顶层拓扑主要有两种一种是“全并行”结构32路SAR各自独立采样、独立转换最后用数字多路复用器把结果拼成一路高速数据流另一种是“分组分层”结构先把32路分成若干组比如4组8路组内先做初步交织组间再做第二级交织。全并行结构的优点是控制逻辑简单每路SAR的时序完全独立校准也相对容易模块化。缺点是数字多路复用器的规模很大32路数据要在极短的时间内完成拼接对数字后端的时序收敛是个挑战。分组分层结构可以缓解多路复用器的压力但引入了额外的时钟相位和同步问题校准的维度也更多。我在实际项目中更倾向于全并行结构因为它的可测试性和可调试性更好。每一路SAR都可以单独使能或旁路方便定位问题。分组结构一旦某一级时钟出问题排查起来会非常痛苦。3. 采样前端32路交织下最容易被低估的细节3.1 采样开关的线性度决定了整个RX的上限采样前端的第一道关卡是采样开关。在56G PAM4的输入带宽下采样开关的导通电阻非线性会直接转化为谐波失真而PAM4对线性度的要求比NRZ苛刻得多——因为PAM4的每个符号有三个眼图任何非线性都会压缩眼高。常见的做法是用自举开关Bootstrap Switch来维持栅源电压恒定从而让导通电阻不随输入信号变化。但在32路交织的场景下自举开关的时钟馈通和电荷注入会变得更加棘手因为每一路的开关都在不同的时钟相位上动作馈通噪声会通过共享的输入节点耦合到其他路。我的经验是在输入节点上做足够的去耦和隔离每一路采样开关的输入走线尽量短且对称。如果版图允许可以在输入节点附近加一个小容值的去耦电容但要注意这个电容不能太大否则会限制输入带宽。3.2 保持电容的选取与kT/C噪声的权衡保持电容的大小直接决定了kT/C噪声的底噪。在56G PAM4的RX里输入信号的幅度通常在几百毫伏量级kT/C噪声必须压到远低于LSB的水平。按照公式kT/C噪声的均方根值等于sqrt(kT/C)在室温下kT约为4.14e-21焦耳。如果保持电容是10fF噪声均方根大约是20微伏如果降到1fF噪声会飙升到64微伏左右。但保持电容也不能无限大。电容越大采样开关的建立时间越长在1.75GS/s的工作频率下建立时间可能只有几十皮秒。电容太大还会增加前一级驱动器的功耗。通常需要在噪声和速度之间做折中10fF到30fF是比较常见的区间。提示保持电容的匹配性比绝对值更重要。32路之间的电容失配会直接导致增益失配而增益失配在交织系统里会产生镜像杂散。版图上一定要用共中心对称或者交叉指状结构来保证匹配。3.3 输入缓冲器的设计带宽、线性度与功耗的三重博弈采样前端前面通常需要一个输入缓冲器来驱动32路采样开关的寄生电容。这个缓冲器的设计是整个RX里最考验功力的地方之一。它需要在14GHz以上的带宽下保持足够的线性度同时功耗不能太高否则整个RX的能效比会很难看。常见的拓扑是源极跟随器加电感峰化或者用Cherry-Hooper结构做带宽扩展。电感峰化在高速设计里很有效但电感的面积极大32路交织的版图里可能放不下太多电感。Cherry-Hooper结构可以在不依赖电感的情况下扩展带宽但会增加功耗和噪声。我的建议是如果工艺允许优先考虑分布式放大器或者行波放大器结构把32路采样开关的电容作为传输线的一部分来吸收而不是用集中式的缓冲器去硬驱动。这样可以在带宽和功耗之间取得更好的平衡。4. 时钟分配与相位校准32路交织的“命门”4.1 32相时钟的生成方式32路时间交织需要32个均匀分布的时钟相位每个相位之间的间隔是采样周期的三十二分之一。在56GS/s的等效采样率下采样周期约为17.86皮秒相位间隔只有约558飞秒。这个精度对时钟生成电路的要求极高。常见的方案是用一个高频锁相环PLL产生一个基础时钟然后通过分频器和延迟锁相环DLL生成32个相位。分频器方案的好处是相位噪声低但分频后的相位精度受分频器匹配的影响。DLL方案可以更灵活地调整相位但锁定范围和抖动性能需要仔细设计。在实际项目中我见过用多级DLL级联来生成32相时钟的方案也见过用PLL直接输出多相时钟的方案。前者功耗更低但锁定时间较长后者相位噪声更好但面积更大。选择哪种方案取决于你的系统对启动时间和抖动的要求。4.2 时钟偏斜的校准从 foreground 到 background时钟偏斜是交织ADC里最致命的失配来源。558飞秒的相位间隔下哪怕只有几十飞秒的偏斜都会在输出频谱上产生明显的镜像杂散。校准时钟偏斜通常有两种思路前台校准和后台校准。前台校准是在系统启动时注入一个已知信号比如一个低频正弦波通过检测输出频谱里的镜像分量来调整每路的时钟延迟。这种方法的优点是精度高、算法简单缺点是需要中断正常的数据传输而且校准结果会随温度漂移。后台校准是在正常工作时持续估计和补偿偏斜。常用的方法是用一个额外的“参考通道”或者利用输入信号本身的统计特性来估计偏斜。后台校准的挑战在于估计精度和收敛速度的平衡算法太复杂会消耗大量数字资源太简单又跟不上温度变化。我的经验是前台校准做粗调后台校准做细调两者结合。前台校准把偏斜压到几百飞秒以内后台校准再慢慢收敛到几十飞秒。这样既能保证启动速度又能维持长期稳定性。4.3 时钟树的版图对称性说起来容易做起来难32相时钟的版图对称性是校准算法能否有效工作的前提。如果时钟树本身的不对称性太大校准算法可能需要很大的动态范围才能补偿甚至可能补偿不过来。版图上的基本原则是从时钟源到每一路SAR的时钟路径长度尽量相等走线的寄生电容和电阻尽量匹配。但在32路交织的版图里完全对称几乎是不可能的因为芯片是二维的而32路SAR的物理位置不可能全部等距。实用的做法是采用“H树”或者“鱼骨”结构来分配时钟尽量让每一路的时钟路径经过相同数量的缓冲器和相同长度的走线。同时在每一路的时钟输入端加可调延迟单元给校准算法留出足够的调节余量。5. 数字校准与数据拼接把32路“缝”成一路5.1 失调、增益、偏斜的三维校准32路交织SAR的数字校准通常要处理三个维度的失配失调、增益和偏斜。这三个失配在输出频谱上表现为不同的杂散模式校准算法需要分别估计和补偿。失调失配表现为输出频谱上的低频杂散校准方法比较简单通常是对每路输出的直流分量做平均然后减去这个平均值。增益失配表现为输入信号频率附近的镜像杂散校准方法是通过检测每路输出的幅度统计特性来归一化。偏斜失配表现为高频的镜像杂散校准方法是通过检测特定频率的镜像分量来调整时钟延迟。这三个校准环路之间会相互影响所以通常需要迭代进行。先校准失调再校准增益最后校准偏斜然后重复几轮直到收敛。校准环路的带宽要仔细设计太宽会引入噪声太窄会跟不上温度变化。5.2 数据拼接的时序收敛32路SAR的输出是32路低速数据流需要拼接成一路高速数据流送给后续的DSP或SerDes解码器。拼接的时序收敛是数字后端的一大挑战因为32路数据到达的时间可能不一致而且每路数据的有效窗口可能很窄。常见的做法是用一个32:1的多路复用器配合一个高速的同步时钟。多路复用器的选择信号需要和32路数据的有效窗口精确对齐否则会出现误码。在版图上多路复用器的布局要尽量紧凑减少走线延迟的差异。如果时序收敛实在太困难可以考虑用两级拼接先做4:1拼接再做8:1拼接。这样每一级的时序压力都会小很多但会引入额外的延迟和功耗。5.3 校准算法的硬件实现代价数字校准算法听起来很美好但硬件实现代价往往被低估。一个32路的LMS自适应校准环路如果每路都需要独立的乘法器和累加器数字面积会非常可观。在实际项目中通常需要在校准精度和硬件代价之间做折中。一种常见的优化是“共享校准引擎”用一个高速的校准引擎分时处理32路的校准数据而不是每路都配一套独立的校准硬件。这样可以把数字面积压到最低但校准的收敛速度会变慢。如果温度变化不快这种折中是可以接受的。另一种优化是用查表法代替实时计算。把常见的失配模式预先算好存在ROM里校准时直接查表。这种方法的精度受限于表的粒度但硬件代价极低。6. 实测中那些文档不会告诉你的坑6.1 输入共模电平的微小偏移会放大成镜像杂散在32路交织系统里输入共模电平的偏移是一个非常隐蔽的坑。每一路采样开关的共模电平如果有微小差异会导致采样时刻的电荷注入量不同进而产生与输入信号相关的失调。这种失调在输出频谱上表现为输入频率附近的镜像杂散而且很难和增益失配区分开。我在一个项目里遇到过这个问题校准算法怎么调都收敛不到理想的杂散水平后来发现是输入共模电平的走线在版图上不对称导致32路的共模电平有几十毫伏的差异。重新做版图把共模走线做成完全对称的树状结构后杂散直接降了十几个dB。注意共模电平的走线一定要和时钟走线一样对待对称性是第一优先级。不要为了省面积而让共模走线绕远路或者穿过其他信号线。6.2 电源噪声通过采样开关耦合进信号链32路SAR同时工作时电源上的开关噪声会通过采样开关的寄生电容耦合到保持电容上。这种耦合在单路SAR里可能不明显但在32路同时开关的场景下电源噪声的幅度会叠加可能直接淹没小信号。缓解的办法是在采样开关的电源上做充分的去耦同时在版图上把采样开关的电源和数字电路的电源分开。如果工艺允许可以用深N井或者独立的电源域来隔离。另外采样开关的使能信号要尽量干净避免和数字信号共享走线。6.3 温度漂移让校准结果“过期”校准算法在常温下收敛得很好但温度一变失配特性就会漂移。尤其是时钟偏斜对温度的敏感度很高。如果校准环路是前台校准温度漂移后需要重新校准但系统可能没有机会中断正常传输。后台校准可以跟踪温度漂移但收敛速度必须足够快。我的经验是后台校准环路的更新时间常数要小于温度变化的时间常数。如果温度变化的时间常数是秒级校准环路的更新时间常数应该在毫秒级。这需要在算法复杂度和收敛速度之间做仔细的权衡。6.4 测试模式的设计决定了调试效率32路交织SAR的调试非常依赖测试模式。如果芯片里没有足够的测试模式一旦出了问题你只能看到最终的高速数据流根本不知道是哪一路、哪个环节出了问题。我的建议是在设计初期就规划好测试模式每一路SAR的输出可以单独引出每一路的时钟相位可以单独调整校准环路的中间变量可以读出。这些测试模式会增加一些面积但调试时节省的时间是值得的。我见过太多项目因为测试模式不足调试周期拖了好几个月。7. 从32路交织再往外看这个架构还能怎么演进32路时间交织SAR在56G PAM4 SerDes RX里已经是一个比较成熟的方案但技术永远不会停在一个地方。往下一代看112G PAM4的SerDes已经在路上了采样率可能要翻倍到112GS/s。如果继续用时间交织路数可能要增加到64路甚至128路那时候时钟分配和校准的复杂度会再上一个台阶。另一个方向是往“混合架构”走用少量高速SAR做粗量化再用时间交织的慢速SAR做细量化类似流水线ADC的思路。这样可以在不增加交织路数的情况下提高采样率但架构的复杂度会更高。还有一个方向是把更多的校准和补偿放到数字域用更先进的DSP算法来替代模拟域的修调。随着工艺节点的推进数字电路的面积和功耗越来越便宜而模拟电路的代价越来越高。把更多的事情交给数字做可能是未来高速ADC设计的一个大趋势。不管架构怎么变采样前端的线性度、时钟分配的精度、以及校准算法的鲁棒性永远是决定系统性能上限的三个关键。把这三个基础打牢再新的架构也能驾驭得住。
返回列表