
摘要水下被动声学识别UATR专注于根据船舶辐射噪声对目标进行分类是水下声学领域的一项关键挑战。近年来基于深度学习的方法因其强大的性能而广受欢迎。然而这些方法在现实场景中往往泛化能力较差。本研究揭示了其中的一个根本性挑战船舶辐射噪声的特性受到诸如船体结构和推进系统等因素的影响。尽管同类型船舶在这些方面可能表现出不同的模式但不同类型船舶之间却可能存在相似之处。因此数据驱动模型往往会过度强调个体特异性特征从而导致“过拟合”和泛化能力差的问题。为缓解这一挑战本文提出了基于动量的对抗训练Momentum-Based Adversarial Training, MBAT框架。MBAT 利用一种动量对抗策略结合类别信息与个体船舶之间的关系有助于提取更具类别判别性的特征。此外还引入了同方差不确定性homoscedastic uncertainty算法用于平衡类别相关特征与船舶个体特异性特征的优化目标。这些策略使模型能够更有效地捕捉类别判别性模式并对未见过的目标实现良好泛化。在 DeepShip 和 ShipsEar 数据集上的实验表明MBAT 在未见个体船舶上的泛化能力显著优于现有最先进的方法。可视化结果进一步验证了所提方法的有效性与必要性。© 2025 美国声学学会。https://doi.org/10.1121/10.0036456一、引言A. 背景水下被动声学识别UATR是水下声学领域的核心课题之一主要聚焦于利用船舶辐射噪声对水下目标进行分类。该技术在海洋资源开发、海上安全保障、科学研究以及海洋生态环境保护等方面具有重要作用Dong 等2021。然而由于船舶辐射噪声具有时变特性且海洋背景噪声复杂多变Wang 等2024使得 UATR 极具挑战性。为实现精准识别研究人员在过去几十年中对此开展了大量分析与研究Niu 等2023。早期的识别系统主要依赖人工设计的声学特征与传统机器学习算法Hummel 等2024严重依赖专家知识且在真实数据上的表现相对较弱。随着计算硬件的发展和公开数据集的积累神经网络方法逐渐成为 UATR 的主流并展现出更优的性能Niu 等2023。近年来许多研究致力于缓解船舶辐射信号固有的复杂性以进一步提升模型的泛化能力。例如Zeng 等人2020采用对抗训练AT来应对复杂的海洋环境Xie 等人2024将卷积神经网络CNN与混合专家MoE结构相结合以减轻水下信号类内差异带来的影响Yang 等人2024a则采用域自适应DA技术提取域不变特征以解决数据分布不一致的问题。尽管 UATR 领域已取得显著进展为后续深入研究奠定了坚实基础但环境条件的复杂性和多样性对识别算法的泛化能力提出了更高要求亟需进一步探索以应对复杂现实场景带来的挑战。B. 动机尽管对水下声学信号的研究不断深入但个体船舶之间的关系对识别性能的影响仍是一个尚未被充分探索的问题尤其是在同一类别内部船舶存在显著差异的情况下。具体而言普遍认为船舶辐射噪声的主要成分包括机械噪声、螺旋桨噪声和流体动力噪声Peng 等2019a。其中机械噪声和螺旋桨噪声尤其受到个体船舶特性如各类机械设备结构和推进系统的影响Peng 等2019a。同类型的船舶在这些方面可能存在显著的设计差异从而产生截然不同的声学模式而不同类别的船舶反而可能表现出相似的属性。我们在图1中通过公开数据集 DeepShipIrfan 等2021中的录音及其对应的声学特征展示了这一现象。图1(a) 和 (b) 分别展示了两艘客船 “Bowen Queen” 和 “Coastal Inspiration”图1© 展示了一艘油轮 “KIRKEHOLMEN”。图1(d)–(f) 为对应录音的梅尔频谱图Mel-spectrogram。与 “Bowen Queen” 采用四方位螺旋桨不同“Coastal Inspiration” 和 “KIRKEHOLMEN” 均使用标准螺旋桨其推进系统更为相似。这种物理特性直接反映在声学特征上如图1(d)–(f) 所示由于推进系统相似均为标准螺旋桨“Coastal Inspiration” 和 “KIRKEHOLMEN” 的梅尔频谱图在时间轴上呈现出明显的周期性条纹而 “Bowen Queen” 则没有这一特征。考虑到特征特性对分类性能的直接影响Wang 和 Zeng2014一个关键问题随之而来这些差异与共性是否也会体现在特征分布中进而影响识别结果为探究这一问题我们在 ShipsEarSantos-Domínguez 等2016和 DeepShip 数据集上进行了实验详见第二节目标是在训练集中未包含的新个体船舶但属于相同类别标签空间上进行识别。图2展示了测试样本潜在表示的 t-SNE 可视化结果其中颜色代表类别形状代表不同个体船舶。ShipsEar 测试集的潜在表示图2(a)明显呈现出按个体船舶聚类而非按类别的趋势表明当数据有限时模型倾向于过度关注个体船舶的特有特征。尽管 DeepShip 数据集的录音数量更大、多样性更高这种倾向依然存在如红色椭圆所示。可以观察到这种倾向带来了两个问题即使在数据相对充足的情况下如 DeepShip也会导致类内差异增大、类间相似性增强这对准确分类极为不利Wen 等2016。图2(b) 清晰地展示了这一现象油轮Tanker的两个圈出区域在潜在空间中相距甚远体现出显著的类内变异而下方区域甚至更接近客船导致类别边界模糊。在测试阶段模型无法获知新个体船舶的身份信息这种混乱的特征分布使得模型难以泛化到未见过的目标即使这些目标与训练数据共享相同的标签空间——而这恰恰是实际应用中至关重要的能力Cao 等2019。C. 本文工作考虑到嵌入在特征中的个体船舶特性会导致识别任务中潜在表示分布混乱如图2所示一个直观的解决思路是在训练过程中削弱这类信息的干扰。为实现这一目标本文提出了一种创新的基于动量的对抗训练Momentum-Based Adversarial Training, MBAT框架。MBAT 在传统识别任务的基础上引入了一个样本对判别任务并结合梯度反转层Gradient Reversal Layer, GRLGanin 等2016以实现对抗训练AT。通过显式建模个体船舶之间的关系所提出的 MBAT 引导模型聚焦于类别层级的判别性特征而非个体船舶特异性特征从而重构潜在表示的分布结构提升识别性能。受 MoCoHe 等2020启发我们在该框架基础上引入了一种基于动量的更新策略以增强训练过程的稳定性和一致性。此外我们采用同方差不确定性算法homoscedastic uncertainty algorithmNeilsen 等2021Kendall 等2018来平衡两个子任务。该方法具有良好的自适应能力无需人工调整超参数显著降低了训练成本。本文的主要贡献如下通过观察与实验分析我们揭示了个体船舶特性会体现在特征分布中导致类内差异增大、类间相似性增强。这一特性严重损害模型在现实场景中的识别与泛化能力针对该问题我们提出了 MBAT 框架利用类别信息与个体船舶关系提取类别判别性特征并采用基于动量的更新策略保障训练稳定性为更好地平衡并促进不同任务间的知识交互我们引入同方差不确定性算法融合与类别信息和个体船舶关系相关的多目标优化我们在公开数据集 DeepShip 和 ShipsEar 上进行了大量实验与可视化分析。结果表明所提出的 MBAT 能有效规整潜在空间中的特征分布。我们的最优模型在 UATR 任务中全面超越现有先进方法在四项指标上平均提升 3.45%。此外该方法在多种骨干网络backbones上均持续取得性能提升充分验证了 MBAT 在性能与泛化能力方面的优越性。二、相关工作A. 水下声学目标识别UATR过去几十年由于其重要性水下声学目标识别UATR领域开展了大量研究。早期方法主要采用手工设计特征结合机器学习分类器。例如Das 等人2013基于频谱分析设计了倒谱特征并使用高斯混合模型GMM进行分类Wang 和 Zeng2014将小波分析与希尔伯特-黄变换应用于船舶辐射噪声信号再用支持向量机SVM分类Ke 等人2020通过小波包分解融合不同子带特征并采用 K 近邻KNN算法分类Wu 等人2018利用维格纳-维尔分布WVD提取特征并同样采用 SVM 进行识别。然而手工设计特征高度依赖专家知识而传统机器学习分类器在面对大规模、高维异构特征空间时泛化能力较差难以满足实际应用需求Irfan 等2021。鉴于上述局限神经网络的兴起提供了新的可能Cao 等人2019结合卷积神经网络CNNLeCun 等1998与二阶池化以捕获时频T-F表示中的相关性Liu 等人2021b构建了三维梅尔频谱图作为卷积循环神经网络CRNN的输入Xie 等人2022a和 Ren 等人2022设计了可学习的前端模块自动提取特征避免人工特征工程Yang 等人2024c提出多特征及其微分信息的融合策略并与 CNN 结合用于目标分类Xie 等人2022b引入源距离等辅助信息通过多模态信息模板提升识别性能Zhou 等人2023b采用多子带特征与基于注意力机制的多尺度卷积网络构建识别系统Xu 等人2023a提出局部掩码与复制LMR数据增强方法及基于平滑性的正则项以提升泛化能力Zhu 等人2023分析了不同频段船舶辐射噪声特性并设计了相应识别算法Zhou 等人2023a针对低信噪比场景提出联合去噪与识别的端到端框架Feng 和 Zhu2022及 Feng 等人2024引入基于 TransformerVaswani 等2017架构与时频 token 聚合模块的识别模型Fan 等人2025改进强大的 Swin-TransformerLiu 等2021c并结合可学习前端实现目标信号识别Yang 等人2024a通过拼接梅尔频谱图增强船舶辐射噪声中的低频成分Li 和 Yang2024将听觉被动注意力机制引入 UATR 系统Xie 等人2024设计了混合专家MoE结构以应对水下声学信号中的类内差异与类间相似性。近年来自监督学习SSL因其无需标注的优势在该领域广受关注Wang 等人2022b在重建任务中采用 fbank 和 gbank 实现 SSLWang 等人2024进一步提出基于 Swin-Transformer 的双通道自注意力声学编码器Xu 等人2023b对对数梅尔频谱图进行掩码与重建学习通用表示再在目标任务上微调。尽管现有研究在特征提取与分类模型方面取得了显著进展但船舶辐射噪声成分复杂且水下声学环境噪声高度可变给算法在真实场景中的稳定性与鲁棒性带来巨大挑战。这种复杂性凸显了进一步提升 UATR 算法性能的必要性尤其是在面对未见目标时的泛化与适应能力Cao 等2019。B. 域自适应DA与域泛化DG域自适应Domain Adaptation, DA与域泛化Domain Generalization, DG是计算机视觉、说话人识别等领域的重要课题。尽管问题定义略有不同二者均旨在解决源域与目标域数据分布不匹配的问题Wang 等2022a。实现该目标的一种途径是学习域不变且具有判别性的潜在特征。部分研究通过显式对齐特征分布实现此目的Li 等人2018采用最大均值差异MMD对齐特征分布Peng 等人2019b通过对齐特征分布的各阶矩学习域不变表示。另一类方法是域对抗训练Domain-ATGanin 等人2016引入梯度反转层GRL通过标准反向传播实现对抗训练Luu 等人2020与 Wang 等人2018将该思想应用于说话人识别并取得成功。由于海洋环境与声传播路径的复杂性水下声学数据集中普遍存在分布漂移与不匹配现象Xu 等2024Jin 等2024。这一特性逐渐受到关注已有研究将 DA/DG 方法引入 UATRXu 等人2024发现水下声学样本的特征分布随时间漂移并提出两种交叉验证方法用于客观性能评估Zeng 等人2020开发了广义通道不变网络以消除船舶辐射噪声中的通道信息Yang 等人2024b利用预测一致性与极小极大熵MME算法处理未对齐数据Yang 等人2024a进一步引入随机分类器以获得域不变表示。然而个体船舶特性对船舶辐射噪声特征分布的影响却鲜有研究。本文在此方向做出补充性贡献我们指出水下声学信号中的类内差异与类间共性Xie 等2024部分源于同类船舶个体间的差异。这些差异在面对未见目标时也会加剧分布不匹配问题。为此我们提出新颖的 MBAT 框架以缓解该问题。加粗样式三、方法论所提出的 MBAT 的核心目标是减轻个体船舶特性对特征分布的干扰从而帮助模型捕获类内不变、类间可分的模式。本节首先介绍梅尔频谱图的提取流程随后说明我们设计的样本配对算法最后详细阐述 MBAT 框架包括对抗训练、动量更新策略、同方差不确定性算法及具体模型架构。A. 声学特征提取B. 样本配对算法C. 针对个体船舶的对抗训练AT图5中黄色区域展示了针对个体船舶的对抗训练Adversarial Training, AT框架MBAT 正是在此基础之上构建的。该框架可分解为三个组成部分D. MBAT 框架在第三节 C 的基础上我们进一步引入了动量编码器Momentum Encoder, ME和同方差不确定性算法与个体船舶对抗训练相结合构成了完整的 MBAT 框架如图6所示。1. 动量编码器ME理想的识别模型应在训练过程中保持参数更新的平滑性与一致性Yang 等2024b。然而如图5所示共享编码器的参数同时受到识别任务和判别任务的影响可能导致梯度冲突Liu 等2021a。此外两个任务需同时处理三个样本锚点、正样本、负样本进一步增加了优化难度。这些因素共同导致训练不稳定——这是对抗学习的典型缺陷Arjovsky 等2017。2. 同方差不确定性算法3. 推理阶段Inference推理阶段的数据流如图7所示。此时动量编码器与判别器被停用因此不会引入额外的计算开销。E. 架构细节MBAT 中各模块的具体结构见表 I。值得注意的是作为一个通用框架MBAT 可兼容多种骨干网络backbones。本文以 SE-ResNetHu 等2018为基础构建模型如图8所示其通过压缩-激励Squeeze-and-Excitation, SE机制动态调整通道间权重以下简称 MBAT-SE。分类器与船舶判别器均采用两层全连接网络。四、实验设置A. 数据集对比实验主要在 DeepShipIrfan 等2021数据集上进行。该水下声学数据集包含总计 47 小时 4 分钟的音频录音采样率为 32 kHz分为四类货船cargo、客船passenger ship、油船tanker和拖船tugboat。其中584 段录音标注了具体的船舶个体信息总时长约 46 小时 16 分钟。ShipsEarSantos-Domínguez 等2016是另一个公开的水下声学数据集包含 90 段录音涵盖 11 种船舶类型及自然噪声。但仅有四类拥有足够且带船舶标注的录音摩托艇motorboat、远洋客轮ocean liner、客船passenger ship和滚装船RoRo。这四类共包含 47 段录音总时长约 2 小时。由于数据稀缺且不平衡我们在 ShipsEar 子集上仅进行小型实验toy experiments以评估 MBAT 对潜在表示分布的规整效果。B. 数据划分UATR 中常见的数据划分方法有三种Liu 等2021bZhou 等2023b 总结如下任务1样本随机划分。所有录音先切分为样本再从中随机抽取训练/验证/测试集任务2按时间顺序划分。每段录音的前 70% 作为训练集剩余部分作为验证/测试集任务3录音级随机划分。先按比例将整段录音分配至训练集或测试集再切分为样本。近期Xu 等人2024指出水下声学目标数据在时间序列上存在相关性若训练与测试数据存在时间重叠会导致识别性能被高估。任务3可避免此问题但仍可能造成个体船舶信息泄露即同一艘船的录音同时出现在训练与测试集中。为深入研究个体船舶特性的影响并对 MBAT 进行无偏评估我们在任务3的基础上进一步禁止训练集与测试集之间出现任何相同的船舶个体。该划分方式还能有效评估模型在面对未见目标时的泛化能力——这对实际应用至关重要Cao 等2019。具体地在 DeepShip 中20% 带船舶标注的数据被随机选为测试集在 ShipsEar 中因数据有限测试集占比约为 17%。表 II 展示了划分后的统计信息。我们已公开数据划分方案以供后续研究使用。C. 参数设置五、结果与分析MBAT 的核心目标是缓解个体船舶特性在识别任务中带来的两大挑战特征分布的类内差异大、类间相似性强对未见目标缺乏泛化能力。为验证所提方法的优越性我们首先将 MBAT 与多种先进方法进行定量性能对比其次通过可视化潜在表示分布直观展示 MBAT 相较基线模型的改进效果最后开展消融实验深入剖析 MBAT 中关键组件的作用以加深对其工作机制的理解。A. 主要结果1. 性能对比为进行定量分析我们在 UATR水下声学目标识别任务中复现了若干现有先进方法作为对比包括带二阶池化的卷积神经网络CNN-SOPCao 等20199 层卷积循环神经网络CRNN9Liu 等2021b强调通道注意力、传播与聚合的时延神经网络ECAPA-TDNNWang 等2022cLMRXu 等2023a基于卷积的混合专家模型CMoEXie 等2024。此外还引入了 UATR 中广泛应用的模型如 ResNet18He 等2016和 XceptionChollet2017进行比较。所有实验均在相同设置下进行每项实验重复三次以提高结果可靠性。采用准确率Accuracy、宏平均精确率Macro Precision、宏平均召回率Macro Recall和宏平均 F1 分数Macro F1-score评估识别性能。实验结果见表 III。可以观察到CRNN9、CNN-SOP 和 ECAPA-TDNN 在测试集上的表现相对较差说明模型在泛化到未见目标方面存在显著挑战。相比之下SE-ResNet18、Xception 和 CMoE 在基线模型中表现更优表明提升模型表达能力有助于增强泛化性能。本文提出的 MBAT-SE 在所有方法中取得最佳结果预测准确率达到 79.87%。与表现最好的基线模型 CMoE 相比MBAT-SE 在四项指标上平均提升 3.45%相较于原始 SE-ResNet四项指标平均提升 3.78%。这些结果充分验证了所提方法的有效性。2. 可视化分析为加深理解在定量评估后开展了可视化实验。对比模型为原始 SE-ResNet18 与对应的 MBAT-SE数据划分与参数配置均遵循第四节所述。由于 DeepShip 测试集规模较大从中随机选取子集用于可视化ShipsEar 测试集则全部展示。所有实验使用相同的可视化数据。将 SE-ResNet18 与 MBAT-SE 编码器的输出作为潜在表示进行可视化图 9(a) 和 9© 分别展示了 SE-ResNet18 在 ShipsEar 和 DeepShip 测试集上的特征分布图 9(b) 和 9(d) 则对应 MBAT-SE 的可视化结果。如第一节所述基线模型的特征分布存在明显的类内差异大、类间相似性强的问题尤其在红色椭圆标记区域尤为突出。相比之下MBAT-SE 显著缩小了 ShipsEar 数据集上的类内距离类别边界更加清晰。在 DeepShip 测试数据上MBAT-SE 的特征按类别而非具体船舶个体形成明显聚类类内紧凑、类间分离度高有利于提升识别性能。表 IV 进一步使用轮廓系数Silhouette ScoreRousseeuw, 1987对聚类效果进行量化评估结果显示 MBAT 在两个数据集上均显著优于基线支持上述可视化结论。3. 不同编码器下的性能一个有效的训练框架不应局限于特定模型结构Yang 等2024a。为验证 MBAT 的广泛适用性我们在不同编码器结构上进行了对比实验结果见表 V。与直接训练相比所提方法在各种编码器结构下均实现性能提升证实了其通用性与适应性。这验证了我们的假设MBAT 能有效从船舶辐射噪声信号中提取复杂表示发现具有优良分类特性的潜在分布。在实际应用中MBAT 框架允许根据任务特点灵活设计和选择合适的编码器从而实现更优的识别性能。B. 消融研究1. 模块有效性我们使用多种编码器进行消融实验以验证 MBAT 中各模块即对抗训练 AT 与动量编码器 ME的贡献。表 VI 所示结果清晰展示了各组件对整体性能的具体影响。MBAT 的两个核心组件在不同编码器结构下均带来显著性能提升AT 模块通过约束隐空间分布缓解了个体船舶特性带来的负面影响相比基线直接训练平均准确率提升 1.29%ME 模块进一步稳定了优化过程帮助网络避免陷入局部极小值或振荡区域从而更平滑地收敛至鞍点。总体而言AT 与 ME 表现出强互补性联合使用可带来 2.79% 的平均性能提升见表 VI。2. ME 融合策略尽管动量更新机制在优化过程中具有优势He 等2020但模块融合方式的设计至关重要。我们实验了四种不同的融合策略如图 10 所示主要区别在于判别器输入的正/负样本来自共享编码器还是动量编码器ME。图 11 展示了不同融合策略的实验结果版本 I分类器无法获取正/负样本信息导致优化受限性能最差版本 II–IV分类器接收所有样本信息版本 III 和 IV 中判别器分别使用共享编码器或 ME 提供的正/负样本版本 II判别器使用 ME 的正/负样本分类器使用共享编码器的所有样本性能最优版本 IV 略优于版本 III。这一现象表明若同时将锚点、正样本、负样本全部送入分类器和判别器会增加优化复杂度并引发梯度冲突。而版本 II 在判别任务中固定正/负样本不计算梯度简化了鞍点搜索过程从而获得最优且最稳定的性能验证了第三节 D.1 中提出的假设。因此最终采用版本 II 的结构进行集成。3. 动量系数的影响MBAT 中的动量系数 m至关重要它控制 ME 保留历史信息的程度 m 越小更新越快。本部分聚焦 m对模型性能的影响。由于各项指标变化趋势一致表 VII 仅展示准确率便于分析。C. 同方差不确定性算法六、结论本文针对个体船舶物理特性差异所导致的船舶辐射噪声信号类内变异大、类间共性多的问题展开研究。为缓解这些复杂特性对识别性能的干扰提出了 MBAT 框架该框架显式建模了个体船舶之间的关系。MBAT 在对抗学习基础上创新性地引入动量编码器ME使其既能提取类别判别性强的表示又能在训练过程中保持稳定性。为进一步提升对特征质量变化的适应能力我们还提出了同方差不确定性算法以自动平衡多任务权重。在两个公开数据集上的大量实验与可视化分析充分证明了 MBAT 的有效性。尽管 MBAT 相较基线模型取得了一致性提升但仍存在局限性依赖个体船舶标签增加了数据采集与标注的复杂度和工作量面对仅有少量录音的独特船舶个体时当前的配对算法与网络架构仍有改进空间。未来工作将聚焦于上述问题的优化。算法搭建中的思考为什么alpha从0然后慢慢增长到1对抗越来越强alpha 决定了“对抗梯度在 encoder 更新中占多大话语权”。从 0 → 1就是让对抗信号从“几乎不说话”→“可以和主任务平起平坐”。