十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

信号处理中的时域特征提取:从基础统计到工程实践

信号处理中的时域特征提取:从基础统计到工程实践 简介本资源是一份面向信号处理初学者与工程实践者的时域特征提取入门工具包聚焦于从原始时间序列中高效提取具有物理意义的统计与形态类特征解决分类、故障诊断、生物信号分析等任务中的特征工程瓶颈问题。压缩包共2个文件11KB含MATLAB核心脚本timeDomainFeatures.m——可直接调用计算平均值、标准差、峰峰值、自相关、路径长度等10类常用时域指标另附详实的Word文档《时域特征提取》系统梳理概念原理、公式推导、适用场景及医学ECG、工业振动等典型应用案例。目前已有2063人学习下载内容兼顾理论严谨性与代码实用性既可作为课程实验补充材料也适合作为语音识别、设备状态监测等项目中快速部署的轻量级特征提取模块。1. 从信号到信息为什么我们需要时域特征在信号处理的世界里我们每天面对的都是海量的、看似杂乱无章的波形数据。无论是工业设备传回的振动信号还是医疗设备捕捉到的心电图亦或是金融市场的价格波动曲线它们本质上都是一串随时间变化的数字序列。直接面对这些原始数据我们往往一头雾水无法直接判断一台机器是否即将故障一个心跳是否异常或者一段语音表达了什么情绪。这就好比给你一张记录了某城市24小时内所有车辆位置和速度的原始数据表你很难一眼看出“今天交通是否拥堵”。但如果你计算出“平均车速”、“拥堵路段占比”、“最高车速与最低车速的差值”这些指标交通状况就一目了然了。时域特征提取做的正是这样一件事它从原始的时间序列信号中计算出一系列有明确物理或统计意义的数值指标将冗长、高维的波形数据压缩成低维、可解释的特征向量从而为后续的分析、诊断、分类和决策提供直接的依据。没有特征提取机器学习模型就相当于在“阅读”天书没有合适的特征再先进的算法也难以发挥威力。时域特征因其计算简单、物理意义清晰、对计算资源要求低成为信号分析中最基础、最常用也往往是第一步的特征工程手段。今天我们就深入聊聊时域特征提取的那些门道从最基础的统计量到进阶的波形指标再到实际工程中的选型心得与避坑指南。2. 基础统计特征信号的第一张“体检报告”当我们拿到一段信号最先做的往往是计算它的一些基本统计量。这就像给人做体检先量身高、体重、血压一样能快速建立一个整体印象。这些特征完全在时间维度上计算不涉及频率变换是最典型的时域特征。2.1 中心趋势与离散程度均值、方差与标准差假设我们有一段信号序列 ( X [x_1, x_2, ..., x_N] )其中 N 是采样点数。均值信号的平均水平反映了信号的直流分量或静态偏移。 [ \mu \frac{1}{N} \sum_{i1}^{N} x_i ] 在振动分析中均值过大可能表示传感器存在零漂或安装基准面有问题在声音信号中均值接近零通常是正常的。方差与标准差衡量信号围绕均值的波动剧烈程度是信号“能量”或“活力”的重要指标。 [ \sigma^2 \frac{1}{N} \sum_{i1}^{N} (x_i - \mu)^2 ] [ \sigma \sqrt{\sigma^2} ] 标准差 (\sigma) 具有和原始信号相同的量纲更直观。例如在轴承故障诊断中随着故障发展振动信号的方差和标准差通常会显著增大。注意计算样本方差时有时会使用 (N-1) 作为分母无偏估计但在特征工程中我们更关注特征值相对变化而非绝对无偏性使用 (N) 作为分母更为常见且与后续其他特征计算保持一致。2.2 分布形态偏度与峰度均值和方差描述了分布的位置和散度但无法区分分布的形状。偏度和峰度弥补了这一点。偏度衡量信号概率分布的不对称性。 [ Skewness \frac{\frac{1}{N} \sum_{i1}^{N} (x_i - \mu)^3}{\sigma^3} ]偏度 ≈ 0分布大致对称如正态分布。偏度 0正偏态分布右侧有长尾均值 中位数。在机械冲击信号中常见表明存在大幅值的正向冲击。偏度 0负偏态分布左侧有长尾。峰度衡量信号分布曲线尖峭或扁平的程度常以正态分布为基准峰度3。 [ Kurtosis \frac{\frac{1}{N} \sum_{i1}^{N} (x_i - \mu)^4}{\sigma^4} ]峰度 3分布比正态分布更尖峭、尾部更厚。这是滚动轴承故障诊断中的一个黄金指标。故障产生的周期性冲击会使信号中出现大量远离均值的峰值导致峰度值显著升高对早期故障非常敏感。峰度 3分布比正态分布更扁平。在实际应用中我习惯将峰度值减去3得到“超额峰度”这样正态分布对应0正值表示重尾更符合直觉。2.3 极值信息峰值、峰峰值、裕度因子对于冲击类故障信号的极值包含重要信息。峰值信号绝对值的最大值。( Peak max(|x_i|) )。它直接反映了信号可能出现的最大瞬时幅值与设备的瞬时负载或冲击强度相关。峰峰值信号最大值与最小值的差值。( P-P max(x_i) - min(x_i) )。它描述了信号的整体波动范围在评估信号动态范围或ADC量程是否合适时非常有用。裕度因子这是一个对冲击异常敏感的无量纲指标。 [ Clearance Factor \frac{Peak}{(\frac{1}{N} \sum_{i1}^{N} \sqrt{|x_i|})^2} ] 它的分母是方根幅值的平方当信号中出现个别极大值的冲击时分子急剧增大而分母变化相对较小因此裕度因子会剧烈增大。它在监测齿轮、轴承的早期点蚀故障时效果有时比峰度更明显。这些基础统计特征计算速度快意义明确构成了时域特征的基石。通常我们会将它们作为一个特征集合一起提取为模型提供信号的多角度“素描”。3. 进阶波形特征刻画信号的“轮廓”与“节奏”基础统计特征描述了信号的“体质”而进阶波形特征则试图刻画信号的“形态”和“变化规律”。这些特征对于区分不同类型的波形模式如周期性冲击、随机振动、正弦波动至关重要。3.1 波形指标形状因子、峰值因子、脉冲因子这是一组经典的无量纲指标在旋转机械故障诊断中应用极广。它们的特点是对故障敏感但对信号幅值和频率不敏感非常适合用于状态监测的阈值报警。均方根值也称为有效值首先需要明确因为它常作为分母。 [ RMS \sqrt{\frac{1}{N} \sum_{i1}^{N} x_i^2} ] 对于交流信号RMS值代表了信号的平均功率。它是振动烈度的标准度量。峰值因子峰值与RMS值的比值。 [ Crest Factor \frac{Peak}{RMS} ]对于纯粹的正弦波峰值因子约为1.414。当信号中出现稀疏的、高幅值的冲击如轴承内圈故障时峰值会显著增加而RMS值可能增加不大导致峰值因子升高。经验之谈峰值因子特别适用于发现早期局部故障。但需要注意当故障发展到非常严重时冲击变得密集RMS值也会大幅上升峰值因子反而可能下降。因此它是一个很好的早期预警指标但不适合用于评估故障严重程度。脉冲因子峰值与绝对平均值的比值。 [ Impulse Factor \frac{Peak}{\frac{1}{N} \sum_{i1}^{N} |x_i|} ] 其物理意义与峰值因子类似但对冲击同样敏感。绝对值平均值计算比RMS更快在嵌入式设备中更有优势。形状因子RMS值与绝对平均值的比值。 [ Shape Factor \frac{RMS}{\frac{1}{N} \sum_{i1}^{N} |x_i|} ]对于正弦波形状因子约为1.11。这个指标对波形形状的变化比较敏感。当信号从正弦波变为方波或含有谐波时形状因子会改变。在实际项目中我通常会同时计算峰值因子和脉冲因子观察它们的变化趋势。如果两者同步快速增长是冲击性故障的强有力指示。3.2 时序相关性特征自相关与互相关相关性特征揭示了信号自身或信号之间在不同时间点上的关联程度。自相关函数描述信号(x(t))与其自身经过时延(\tau)后的信号(x(t\tau))的相似性。 [ R_{xx}(\tau) \frac{1}{N} \sum_{t1}^{N-\tau} x(t) \cdot x(t\tau) ] 为简化未做去均值等处理实际计算常使用协方差形式。在(\tau0)时自相关值最大等于信号的均方值。对于周期性信号自相关函数也会呈现出相同的周期。这个特性非常有用在强噪声背景下直接观察原始信号可能看不到周期但计算自相关函数后噪声成分随机不相关会相互抵消而周期性成分会被增强从而清晰地暴露出来。这对于从嘈杂信号中提取故障特征频率至关重要。互相关系数如果需要比较两个不同信号如两个通道的振动在零时延下的整体相似性可以使用皮尔逊相关系数。 [ \rho_{xy} \frac{\sum (x_i - \mu_x)(y_i - \mu_y)}{\sqrt{\sum (x_i - \mu_x)^2 \sum (y_i - \mu_y)^2}} ] 其值在[-1, 1]之间。1表示完全正相关-1表示完全负相关0表示不相关。在多传感器系统中可以用它来判断故障发生的部位例如靠近故障源的传感器信号之间相关性会更高。3.3 基于直方图的特征熵与能量将信号的幅值范围划分为若干个区间bin统计信号值落在每个区间内的点数形成幅值直方图。基于这个直方图可以计算信息熵。幅值域熵反映了信号幅值分布的不确定性或混乱程度。 [ H -\sum_{k1}^{M} p_k \cdot \log_2(p_k) ] 其中(M)是直方图区间数(p_k)是信号值落在第k个区间的概率频率。当信号幅值分布非常均匀接近均匀分布时熵值较大。当信号幅值集中在少数几个区间如健康的周期性信号时熵值较小。当设备发生故障信号中引入随机冲击或噪声时幅值分布可能变得更“散”导致熵值增大。熵特征在轴承和齿轮箱的退化评估中常有应用。波形能量虽然有时被归为时域特征但更严格地说它是基于幅值的。即信号各点幅值平方和( Energy \sum_{i1}^{N} x_i^2 )。它与RMS值直接相关(Energy N * RMS^2)通常用于需要衡量整体能量大小的场景。4. 工程实践特征提取流程、陷阱与调优心法理论上的特征琳琅满目但落到实际工程代码和项目中如何高效、可靠地提取特征并让它们真正发挥作用才是考验功力的地方。这一部分我结合多次踩坑的经验分享一套可落地的实践流程和关键注意事项。4.1 标准化的特征提取流水线一个健壮的特征提取流程绝不仅仅是调用几个库函数。以下是我推荐的步骤数据预处理前置清洗去趋势使用线性拟合或滑动平均移除信号中缓慢变化的趋势项。趋势项会严重影响均值、方差等特征。对于振动信号这通常是必须步骤。去直流直接减去信号均值。确保后续分析针对交流分量。异常值处理对于因传感器失灵或电磁干扰产生的瞬态尖峰需要采用阈值法或中值滤波进行剔除或平滑否则峰值、峰度等特征会被严重扭曲。标准化/归一化如果特征要输入机器学习模型通常需要进行标准化减均值除以标准差或归一化缩放到[0,1]。关键点务必用训练集的统计量均值、标准差、最大最小值来转换验证集和测试集这是新手常犯的错误会导致数据泄露模型评估结果虚高。滑动窗口分割 对于长时间序列我们需要将其切分成一个个短时窗口进行分析。窗口长度是关键参数。原则窗口应至少包含主导频率成分的多个周期。例如对于转频为10Hz的设备采样率1000Hz一个周期100个点。窗口长度通常取512、1024、2048等2的幂次方便于FFT。对于10Hz1024点约1秒包含了10个周期通常足够。重叠率为了增加数据量和平滑分析结果相邻窗口可以重叠50%-75%。重叠越高生成的特征序列越平滑但计算量和数据冗余也越大。特征计算与向量化 对每个窗口并行计算所有选定的时域特征形成一个特征向量。假设我们选了10个特征处理1000个窗口就会得到一个1000x10的特征矩阵。这里强烈建议使用向量化计算库如NumPy避免在Python中写for循环效率有数量级提升。特征后处理缺失值处理某些特征在特殊信号下可能计算无效如除零。需要填充用前后值或均值或剔除该窗口。平滑滤波生成的特征序列可能仍有毛刺可以用滑动平均或低通滤波进行平滑使趋势更明显。4.2 特征选择与评估避免“维度诅咒”提取出几十个特征后不能一股脑儿扔给模型。无关或冗余的特征会降低模型性能、增加过拟合风险、拖慢训练速度。过滤法快速初筛。方差阈值移除方差接近0的特征即该特征在所有样本上几乎不变。相关性分析计算特征与目标标签的相关性对于分类/回归问题保留相关性高的。同时计算特征之间的相关性如果两个特征高度相关如RMS和方差保留一个即可。包裹法以模型性能为导向。 使用递归特征消除等算法看模型在特征子集上的表现。效果最好但计算成本高。嵌入式法模型自带选择。 使用L1正则化Lasso的线性模型或基于树模型的特征重要性排序。这是实践中平衡效果与效率的常用方法。我的常用策略先计算所有基础时域特征约15-20个然后用树模型如随机森林或XGBoost跑一遍初步训练根据特征重要性排序剔除重要性为0或极低的特征。对于剩余特征观察两两相关性热力图手动剔除一些物理意义重复的。4.3 实战中的高频“坑点”与应对策略坑点一采样率与混叠。这是根源性错误。如果采样频率 (f_s) 不满足奈奎斯特采样定理(f_s 2f_{max})(f_{max})是信号最高频率高频成分会混叠到低频中所有时域特征都会失真。对策在传感器和ADC之前必须使用抗混叠滤波器。明确你关心的最高频率并设置至少2.5倍以上的采样率。坑点二非平稳信号的窗口陷阱。时域特征默认假设信号在分析窗口内是平稳的。对于转速剧烈变化如启动、停机的设备这个假设不成立。对策对于变速工况要么采用阶次分析转为角域平稳信号再提取特征要么使用极短的窗口但会损失频率分辨率要么转向时频分析如小波变换。坑点三特征对负载/转速敏感。很多时域特征如RMS、峰值会随设备负载和转速变化而自然变化这可能掩盖故障引起的微小变化。对策使用无量纲指标峰值因子、脉冲因子、峰度它们对运行条件的变化相对不敏感。或者建立不同工况下的基线模型进行相对比较。坑点四计算效率与实时性。在嵌入式设备或需要处理海量数据的场景计算所有特征可能吃不消。对策进行性能剖析找出计算瓶颈。方差、均值等可迭代计算峰度、偏度涉及高次幂较慢。根据业务需求精选最有效的几个特征。对于滑动窗口可以利用重叠窗口间数据的相关性优化计算避免重复运算。5. 案例深潜基于时域特征的滚动轴承故障诊断让我们通过一个经典场景——滚动轴承故障诊断来串联上述所有知识。假设我们有一个驱动电机轴承的振动加速度信号采样频率12.8kHz我们怀疑其外圈存在早期点蚀故障。5.1 故障机理与特征预期滚动轴承外圈故障会产生周期性的冲击脉冲脉冲重复频率称为外圈故障频率BPFO由轴承几何参数和转速决定。这些冲击会激发传感器及结构的固有频率形成一系列衰减振荡波形。在时域上我们预期看到信号幅值整体可能略有上升RMS增大。信号中会出现周期性的、幅值远高于背景振动的冲击脉冲峰值、峰峰值增大。由于冲击脉冲的稀疏性和高幅值信号的分布会偏离正态分布出现重尾峰度、裕度因子显著增大。脉冲的周期性可能被噪声淹没但在自相关函数中会显现。5.2 特征提取与对比分析流程我们采集了健康状态和故障状态下的多段振动信号。处理流程如下数据准备对每段信号去直流、去趋势高通滤波。截取稳定转速下的数据段。窗口划分取窗长8192点约0.64秒重叠率50%。确保窗口包含足够多的转频周期和可能的故障冲击周期。特征计算对每个窗口计算一个包含以下特征的向量基础统计均值、标准差、偏度、峰度超额峰度。波形指标峰值、峰峰值、RMS、峰值因子、脉冲因子、裕度因子。其他波形因子、幅值域熵。特征聚合对于每个状态健康/故障我们得到了多个窗口的多个特征值。通常我们计算每个特征在所有窗口上的平均值或中位数作为该状态样本的最终特征值。为了直观对比我们可以将健康与故障状态的特征值列成表格特征指标健康状态 (平均值)故障状态 (平均值)变化幅度敏感度评价RMS0.15 m/s²0.21 m/s²40%中等受工况影响大峰值1.2 m/s²3.8 m/s²217%高但易受偶发噪声干扰标准差0.148 m/s²0.208 m/s²41%同RMS峰度 (超额)-0.15.2急剧增大非常高早期故障敏感峰值因子8.118.3126%非常高对冲击特异脉冲因子7.516.9125%非常高与峰值因子互补裕度因子5.612.4121%高对稀疏冲击敏感幅值熵4.5 bit5.8 bit29%中等趋势性变化从上表可以清晰看出峰度、峰值因子、脉冲因子、裕度因子这四个无量纲指标在故障状态下发生了数量级或翻倍的增长变化最为剧烈是诊断外圈故障的强特征。RMS和标准差也有增长但变化比例不如前者且更容易受到设备负载变化的影响。峰值虽然增长很大但单一点的特异性太强容易受非故障冲击如碰撞干扰。5.3 特征趋势分析与阈值设定在实际监测中我们更关注特征随时间的变化趋势。我们可以每天计算轴承振动信号的特征值绘制其趋势图。假设我们以峰值因子和峰度作为主要监测指标。在设备运行初期建立其健康状态的基线值例如峰值因子基线8.0峰度基线3.0和正常波动范围如±2倍标准差。当连续多个点的特征值超过基线值的2.5倍或超过统计控制上限并且呈现持续上升趋势时就可以触发预警。相比于设定一个固定的绝对阈值这种基于历史基线的相对阈值方法更能适应不同设备、不同工况的个体差异。一个重要的心得不要依赖单一特征做判断。应该观察一个特征集合如“峰度峰值因子脉冲因子”的协同变化。如果它们同步增长是故障的强证据如果只有某一个特征突变则需要排查是否是测量干扰。6. 超越基础时域特征的融合与创新思路纯粹的时域分析有时会遇到瓶颈比如对复合故障、微弱故障区分度不够。这时我们需要更巧妙的思路。6.1 时域特征的组合与派生我们可以将基础特征进行组合创造出物理意义更强的新特征。脉冲-峰度比( \frac{Impulse Factor}{Kurtosis} )。尝试刻画冲击的“尖锐度”与分布“重尾性”之间的关系。波形复杂度可以尝试用多个波形指标形状因子、峰值因子、脉冲因子的熵或主成分来综合描述。差分特征计算原始信号的一阶差分近似导数序列再对这个差分序列提取同样的时域特征集。差分序列放大了信号的变化率对冲击的上升沿和下降沿更敏感可能揭示出原始信号中不明显的信息。6.2 与频域特征的融合时域特征和频域特征从FFT频谱中提取如重心频率、均方频率、频率熵等是从不同角度描述信号。它们不是替代关系而是互补关系。早期故障时域的峰度、峰值因子可能更敏感。发展期故障频域中故障特征频率的幅值增长会更明显。复合故障需要同时观察时域波形和频谱图。最常用的方法就是特征融合将时域特征向量和频域特征向量拼接成一个更长的“时频联合特征向量”输入给分类器如SVM、神经网络。这往往能获得比单一域特征更好的分类精度。6.3 基于深度学习的端到端特征学习这是当前的前沿方向。我们不再手动设计峰度、峰值因子等特征而是将原始的时域信号切片直接输入一维卷积神经网络1D-CNN或Transformer模型。模型的底层卷积核会自动学习到类似于滤波器的作用高层网络则自动组合出对分类任务最有效的抽象特征。这种方法优势明显省去了复杂的特征工程理论上能学到更优的特征表示。但其劣势同样突出需要大量的标注数据模型是“黑箱”可解释性差在工业界对可靠性要求极高的领域工程师往往更信任机理清晰的传统特征。目前一个折中的方案是将手工特征作为补充与深度学习模型提取的特征一同使用。从我个人的项目经验来看对于数据量有限、对可解释性要求高的传统工业场景精心设计和选择的时域特征集合依然是性价比最高、最可靠的方案。而对于互联网、语音等数据丰富且模式复杂的场景端到端深度学习正逐渐成为主流。理解时域特征的原理不仅能让我们用好它更是我们理解更高级方法的基础。当你看到CNN学习到的特征图时如果能联想到它可能是在提取某种“非线性峰度”或“局部脉冲模式”你的理解层次就完全不一样了。特征提取终究是连接物理世界与数字智能的桥梁而时域是这座桥梁最坚实、最直观的起点。本文还有配套的精品资源点击获取
返回列表