十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

PCIe数字化仪实时采集:从链路预算到DMA描述符环的工程实践

PCIe数字化仪实时采集:从链路预算到DMA描述符环的工程实践 做 PCIe 数字化仪的朋友大概都有过这种体验采集卡插进机箱设备管理器里看到一把未知设备或者 dmesg 里刷出来一堆 PCIe 错误等把驱动、BAR、DMA 调通数据一跑起来上位机又处理不过来缓冲陆续被填满原来的“实时采集”变成了“事后回放”。这里面的核心矛盾其实很简单ADC 的采样时钟不等人而 PCIe 的带宽和上位机的处理能力是有限的。PCIe 数字化仪Digitizer听起来很高端本质上就是一块高速数据采集卡把模拟电压信号变成数字样本再通过 PCIe 总线送到主机。难点不在“采集”而在“持续采集”。你手里的示波器采集几微秒然后做处理那是非实时工业相控阵、雷达中频回波、粒子物理探测器这些场景信号可能连续几个小时不间断每一微秒的数据都不能丢。标题里的 Real-Time Processing说的就是在数据流不断流的情况下采样、传输、处理、显示四个环节同时在线。这篇内容适合两类人一类是做 FPGA 和采集板卡开发的硬件工程师另一类是在做上位机采集软件、同时被驱动和 DMA 折磨的软件工程师。两类人看问题的角度不同但最后都要落在同一个系统上。1. 先搞清楚PCIe 数字化仪的“实时”到底卡在哪1.1 数字洪流到底有多大先拿一个最常见的例子算笔账。假设数字化仪是 4 通道、125 MSPS、14 bit。14 bit 在 DMA 传输时通常会按 16 bit2 字节对齐单通道数据率就是 125M × 2B 250 MB/s4 通道加起来正好 1 GB/s。如果你用的是 500 MSPS、双通道的板卡数据量直接翻到 2 GB/s。2 GB/s 什么概念一块 PCIe Gen3 x4 的链路理论带宽约 3.938 GB/s看起来够但那是线速去掉 128b/130b 编码和 TLP 包头开销、DMA 描述符交互、主机侧内存拷贝实际可用吞吐能到 70%~80% 就算优化得很好了也就是 2.8~3.2 GB/s。如果 FPGA 和主机之间做的是小包传输每个 TLP 只带 64 字节数据有效带宽可能拦腰斩半。所以做 PCIe 数字化仪第一件事不是选 FPGA 型号而是把峰值数据率、平均数据率、突发数据率都算清楚。峰值数据率决定你要不要上 Gen3 x8 甚至 x16平均数据率决定上位机的处理线程能不能“吞得下”突发数据率决定板卡上的缓存要开多大。我之前见过一个项目总平均数据率只有 800 MB/s但突发时能冲到 1.6 GB/s结果板载 DDR 缓存配小了一遇突发就丢数查了一个月才发现不是 PCIe 问题是缓存深度问题。1.2 “实时”不是一个开关是三个层次很多人在沟通需求的时候把“实时”当做一个模糊口号我建议拆成三层看。采集端实时ADC 产生的样本必须被 FPGA 无缝隙接收只要 FIFO 或 DDR 缓冲耗尽数据就断档了。这一层决定硬件设计要留多大缓冲。传输实时DMA 把 FPGA 里的数据持续搬到主机内存传输速度必须赶得上采集速度否则板卡上的缓冲迟早溢出。这一层决定 PCIe 链路怎么配置、驱动怎么写。处理实时主机侧或者 FPGA 内部的数据处理必须在给定时间内完成而且结果出来的时刻是确定的。这层最容易被低估因为 CPU 的调度、中断、缓存缺失都可能让处理时间抖动。曾经有个客户跟我说“我要实时 FFT 频谱”我问他实时的标准是什么他说数据来了就能看到。我接着问允许 10 ms 延迟吗允许偶发 50 ms 的界面掉帧吗最后定下来 10 ms 内必须出结果且 99.9% 的情况下抖动不超过 5 ms。只有把指标量化软件和硬件才知道该怎么设计。这也是为什么我一听人说“实时”就头大一定要追着问延迟、吞吐、抖动、丢包率这四个数字。2. 硬件侧先算账再选料PCIe 数字化仪本质上是混合信号系统前端模拟链路、ADC、FPGA、PCIe 接口、电源、时钟。绝大多数我见到的失败项目问题不在某一个器件而在链路预算和时序设计上。这里把几个关键决策点过一遍。2.1 ADC 和 FPGA 怎么选ADC 和 FPGA 之间的数字接口现在有两条主流路线并行 LVDS 和 JESD204B。低速并行 LVDS 比较好调试逻辑也简单高速、超过几百 MSPS 的基本都走 JESD204B/C它省引脚、自带多通道对齐机制但要去解决确定性延迟和 SYSREF 同步的问题。做 4 通道以上同步采集卡建议直接选 JESD204B/C 方案的 ADC否则 FPGA 引脚数和 PCB 布局都会很痛苦。FPGA 选型最重要的指标不是逻辑单元而是高速收发器和 PCIe 硬核。Xilinx/AMD 的 UltraScale 和 Kintex 系列自带 PCIe 硬核是采集卡厂商的主流选择国产的紫光同创 PGT 系列也有 PCIe PHY 硬核资源但生态和 IP 成熟度相对弱一些。选型时一定要搞清楚你手里的 FPGA 是用 PCIe 硬核还是需要用收发器加软核方式实现。Perst、参考时钟、复位时序这些信号在硬核方案里通常都有比较成熟的约束但国产 IP 往往需要你自己处理得更细。如果你准备自研 RTL把 XDMA 这一类官方 IP 当作参照还是当作替代是两条完全不同的开发路径工作量和风险都不一样。2.2 链路预算Gen3 x4 到底够不够做链路预算不要只看理论带宽还要看 TLP 结构。PCIe 传输以 TLP 为单位一般默认最大载荷MPS128 字节或 256 字节。一次写事务的包头开销约 12~20 字节如果带可选头会更多DMA 还要下发描述符、回写状态。我算项目吞吐一般按线速的 78%~82% 来估这里给个对照表链路每通道线速单向理论总带宽单向实际可用预估Gen2 x45 GT/s2 GB/s约 1.6 GB/sGen3 x48 GT/s3.94 GB/s约 3.1 GB/sGen3 x88 GT/s7.88 GB/s约 6.2 GB/sGen4 x416 GT/s7.88 GB/s约 6.4 GB/sGen4 x816 GT/s15.75 GB/s约 12.6 GB/s如果你的峰值数据率在 1 GB/s 上下Gen3 x4 够用但要注意同一台机器上如果有别的 PCIe 设备抢占带宽或者链路会降速到 Gen2那就要留余量。如果峰值超过 2 GB/s我建议直接上 x8。原因很简单DMA 引擎在 PCIe 链路上跑满数字并不容易带宽余量越大调试空间越大。数字化仪最怕的就是“平时好好的碰巧数据突发就断”余量就是用来预防这种偶发问题的。2.3 时钟采样时钟、参考时钟和同步时钟问题是 PCIe 数字化仪里最容易踩坑的地方。PCIe 链路本身需要一组 100 MHz 差分参考时钟这是协议要求的少一根都枚举不过去。ADC 的采样时钟最好独立于 PCIe 参考时钟用低抖动晶振或时钟芯片产生。很多第一次做采集卡的人会把采样时钟和 PCIe 参考时钟混在一起结果采样时钟的抖动直接恶化 ADC 信噪比同时 PCIe 链路训练还可能失败一举两失。要做多卡同步时钟会复杂很多所有卡的采样时钟必须同相一般用外部 10 MHz 参考加 PLL 倍频再配合 SYSREF 做确定性延迟。主流方案是用一整套 JESD204B 时钟树比如 LMK04828 这类芯片。调试的时候不能只看频谱还要用示波器打 SYSREF 和 CLK 的相位对齐这个步骤很多人会跳过直到多卡数据通道数对不上才回过头来补。3. PCIe 底层那些事枚举、TLP 和 DMA3.1 枚举与 BAR从头建立设备“户口”设备识别失败是 PCIe 调试中最常见的问题紫光同创 PGT 调试或 Xilinx FPGA 的 PCIe IP 调不通大概率不是逻辑写错了而是枚举阶段就没过。枚举大体是这样主机复位后对每个总线号、设备号、功能号发起配置请求读到 Vendor ID 和 Device ID 后分配总线号然后依次读 BAR确定设备需要多少地址空间最后分配并写入这些地址。如果设备节点始终不出现我总结出三个初查点。第一在 BIOS 里看能不能看到板卡如果 BIOS 里都看不到基本是硬件或链路训练问题先测参考时钟第二用 lspci -vvv 看链路是否 LinkUp、当前速率是 Gen1/2/3如果只有 Gen1说明训练过程被中断过或均衡EQ没完成第三很多国产 FPGA 的 PCIe IP 在复位释放时序上有要求PERST# 必须晚于电源稳定和参考时钟稳定而且要保证足够的复位时间。我之前有块卡时而能看到时而看不到最后顺着 PERST# 电阻电容的时间常数查发现复位释放早于时钟稳定几百微秒导致每次上电状态不确定。这种问题在仿真里很难发现只能靠实测。3.2 TLP 打包别忽视状态机的边界条件热词里有个“pcie tlp header打包状态机”我很有感触。实现 DMA 写或者读的时候FPGA 内部通常有个状态机把 AXI-Stream 数据流按长度分组填上 TLP 头Fmt、Type、Length、Requester ID、Tag、地址等加上 ECRC再送进 Transaction Layer。比如一次 Memory WriteFmt 决定是 3DW 还是 4DW 头Length 以 4 字节为单位32 位地址用 3DW 头64 位地址或地址在 4G 以上就必须用 4DW 头。这块容易出 bug 的点通常是最后一个不完整 DWORD 的长度计算、跨 128 字节边界拆分 TLP、Tag 资源管理、接收端 Completion 超时。写状态机的时候一定要在验证环境里覆盖“数据长度任意、不等于 4 的倍数”的情况否则实际跑 DMA 时数据会错位。还要说一个概念上的分工PCIe IP 内部有 Controller 和 PHY/PCS 两层PCS 负责 128b/130b 编解码、弹性缓冲、链路训练状态机这些底层事Controller 负责 TLP、ACK/NAK、流控。TLP 错误优先查 ControllerLinkUp 不上或者信号质量差优先查 PHY/PCS 这一侧。3.3 DMA 描述符环把主机内存交给板卡DMA 是 PCIe 数字化仪的命脉。我常用描述符环Descriptor Ring的方式主机驱动在内存中开一块环形队列每个描述符写“缓冲区地址 长度 控制字”FPGA 的 DMA 引擎按顺序取描述符把数据写到对应地址完成后回写状态并产生 MSI/MSI-X 中断。这样大块传输不需要 CPU 参与效率高。设计时注意两个参数描述符数量和缓冲区大小。描述符太少高吞吐时来不及循环缓冲区太小主机来不及处理。我见过一个项目DMA buffer 只有 4 MB采集数据率 1 GB/s也就是说 4 ms 内必须把一次 DMA 周期处理完一旦上位机忙了 4 ms数据就丢。最后把 buffer 扩到 32 MB加上多组描述符丢数问题立刻就好了。这不是算法问题纯粹是缓冲容量和系统的处理节奏不匹配。3.4 IOMMU/SMMU地址映射这道坎绕不过去很多人 x86 上跑 DMA 没问题拿到 ARM 平台比如飞
返回列表