NeurIPS 2026|噪声遇上长尾:让稀有类别在少标注下获得更多学习机会
真实视觉任务中的数据往往同时具有两个特点:一方面,大量类别之间存在明显的数据不均衡,常见类别占据大量训练样本,而稀有类别只占很小一部分;另一方面,图像本身还可能受到噪声、散射、低对比度、雨雪雾等复杂成像因素影响。
对于依赖伪标签的半监督语义分割来说,这两个问题会进一步相互叠加:
噪声降低预测置信度,长尾类别本身又更难学习,最终导致稀有类别更容易在伪标签筛选阶段被过滤。
FTC-Seg(Feature-Threshold Dual Calibration)针对这一问题,从特征表示和伪标签筛选阈值两个层面进行校准。
论文:
When Noise Meets Long-Tail: Feature-Threshold Dual Calibration for Robust Pseudo-Labeling
已被NeurIPS 2026 Main Track接收。
目前已经公开:
- 训练代码
- 推理与评估代码
- FLSMD / FSSG / SUIM / ACDC 四个数据集配置
- 四个数据集的验证列表
- 统一的数据组织格式
- FSSG、FLSMD 整理后的数据入口
- SUIM、ACDC 官方数据入口与完整整理说明
- mIoU、per-class IoU 和 segmentation prediction 输出流程
GitHub:https://github.com/pingggg516/FTC-Seg
Paper:https://arxiv.org/abs/2609.33668
一、核心思路:把被过滤的稀有目标重新带回训练
图 1. FTC-Seg 通过特征与阈值双重校准,缓解尾类伪标签被持续过滤的问题。
在常见的半监督语义分割中,模型首先对未标注图像产生预测,再利用高置信度预测生成伪标签,用这些伪标签继续训练模型。
问题在于,当噪声与类别长尾同时存在时,低频类别往往会更早失去监督。
一个典型过程是:
尾类样本较少
→ 特征学习不足
→ 预测置信度偏低
→ 固定高阈值将其过滤
→ 未标注数据无法继续提供尾类监督
→ 尾类特征进一步退化
图 1(a) 中可以看到,模型实际上已经在稀有目标区域产生了预测,但预测置信度未达到统一阈值,因此这些区域在后续训练前直接被过滤。
FTC-Seg 从两个位置进行干预:
Orthogonal Prototype Reconstruction(OPR)
从特征层面改善目标与噪声背景之间的可分性,使受到干扰的目标特征更容易被模型识别。Adaptive Threshold Calibration(ATC)
不再对所有类别使用完全相同的固定阈值,而是根据类别的学习状态与预测分布动态调整伪标签筛选门槛。
两部分分别作用在:
特征质量 → 预测置信度 → 伪标签筛选
这条链路的不同位置,目标都是减少低频类别由于置信度不足而被持续排除的问题。
二、跨场景验证:声呐、水下光学与恶劣天气
论文在FLSMD、FSSG、SUIM、ACDC四个公开数据集上进行实验,覆盖三种明显不同的复杂成像条件:
- Acoustic Speckle:声学散斑
- Underwater Optical Scattering:水下光学散射
- Adverse-weather Imaging:恶劣天气成像
实验使用:
- 2% 标注
- 5% 标注
- 10% 标注
三种半监督设置,并从整体分割性能、稀有类别表现和伪标签质量等多个角度进行分析。
ACDC:恶劣天气道路场景
图 2. ACDC 恶劣天气道路场景的分割对比,采用 2% 标注数据。Ours 为 FTC-Seg,GT 为人工标注。
ACDC 包括:
- Fog
- Night
- Rain
- Snow
等复杂道路环境。
这类场景中,小目标、低频类别和远距离道路参与者容易受到天气和成像质量影响,因此可以用于研究:
- Robust Semantic Segmentation
- Adverse Weather Perception
- Autonomous Driving
- Rare Road-user Segmentation
- Semi-supervised Driving Scene Understanding
SUIM:水下光学场景
图 3. SUIM 水下光学场景的分割对比,采用 2% 标注数据。
水下光学图像通常同时受到:
- 光线衰减
- 散射
- 低对比度
- 色偏
- 背景干扰
等因素影响。
因此这一设置可以用于:
- Underwater Vision
- Underwater Robotics
- Robust Segmentation
- Rare Underwater Object Recognition
- Low-quality Image Segmentation
- Semi-supervised Underwater Perception
FSSG / FLSMD:前视声呐场景
FSSG 和 FLSMD 均为 Forward-Looking Sonar(FLS)语义分割数据。
前视声呐图像通常具有:
- Speckle Noise
- 低纹理
- 阴影
- 目标轮廓模糊
- 背景噪声强
- 类别分布不均衡
等特点。
对应的研究方向包括:
- Sonar Image Segmentation
- Underwater Acoustic Perception
- Marine Object Segmentation
- Marine Debris Segmentation
- Low-texture Semantic Segmentation
- Noise-robust Underwater Perception
Pascal VOC:进一步的控制实验
除四个主要 benchmark 外,论文附录还在Pascal VOC上构造了:
- Long-tail only
- Long-tail + Gaussian noise
两种 controlled setting。
这一实验主要用于进一步检查:
“噪声与长尾共同影响伪标签学习”
这一现象是否只存在于声呐、水下光学或恶劣天气等特殊成像场景。
三、哪些研究可以把 FTC-Seg 作为 Baseline 或对比方法?
FTC-Seg 的实验设置同时涉及:
半监督学习、少标注学习、类别长尾、成像退化、稀有类别学习、伪标签筛选和类别自适应阈值。
因此,除了完全相同的“Noise + Long-tail”问题之外,在多个相关研究方向中也可以作为对比方法。
| 研究方向 | FTC-Seg 可以承担的对比角色 | 重点比较内容 |
|---|---|---|
| 半监督语义分割 | Teacher–Student + Pseudo-labeling 类半监督方法 | mIoU、per-class IoU |
| 少标注学习 | 在相同 2% / 5% / 10% 标注预算下比较未标注数据利用能力 | 不同 label ratio 下的 mIoU |
| 长尾语义分割 | 比较不同方法是否真正改善低频类别 | Tail IoU、Head/Tail Gap |
| 类别不均衡学习 | 与 re-weighting、re-sampling、distribution alignment 等策略比较 | Head / Tail performance |
| 稀有类别识别 | 检查新方法是否减少低频类别漏分割 | Tail Recall、Tail IoU |
| 伪标签学习 | 比较不同伪标签生成与筛选策略 | Pseudo-label Accuracy、Filtered Rate |
| 自适应阈值方法 | 与固定阈值、类别动态阈值策略进行比较 | Recall、Precision、Pseudo-label Coverage |
| Teacher–Student SSL | EMA Teacher–Student 框架下的半监督分割方法 | mIoU、Pseudo-label Quality |
| DINOv2-based Segmentation | DINOv2-S backbone 下的半监督分割方法 | 精度、尾类表现、计算开销 |
| 噪声鲁棒语义分割 | 比较低质量图像和复杂成像条件下的稳定性 | Robust mIoU、Tail Performance |
| 恶劣天气分割 | ACDC 上比较雨、雪、雾、夜间场景 | mIoU、低频道路类别 IoU |
| 水下视觉 | SUIM 上比较散射、低对比度条件中的分割 | mIoU、Rare-object IoU |
| 声呐图像分割 | FSSG / FLSMD 上比较散斑噪声下的语义分割 | mIoU、Tail IoU |
| Prototype-based Segmentation | 与 prototype learning / feature calibration 方法比较 | Feature Quality、Tail IoU |
| Robust Pseudo-labeling | 比较复杂成像条件下可靠伪标签保留能力 | Accuracy、Coverage、Filtered Rate |
| Long-tail + Noise 联合鲁棒性 | 直接分析两个因素共同存在时的性能退化 | Interaction、Tail Exclusion |
| 低置信度伪标签利用 | 比较不同方法如何利用原本会被过滤的预测 | Recall、Precision、Coverage |
| 高效半监督分割 | 同时比较性能和额外计算成本 | Params、FLOPs、FPS、mIoU |
可以进一步迁移的任务
下面这些任务同样具有少标注、类别不均衡、稀有目标和复杂成像等特点,也很适合将 FTC-Seg 作为对比方法或迁移基线。
遥感语义分割
遥感场景中经常同时存在:
- 稀有地物类别
- 类别比例极度不均衡
- 云雾与低质量成像
- 低分辨率目标
- 标注成本高
因此可以进一步测试:
- Semi-supervised Remote Sensing Segmentation
- Long-tail Remote Sensing Segmentation
- Rare Land-cover Segmentation
- Low-quality Remote Sensing Segmentation
工业缺陷分割
工业视觉中常见:
- 正常类别远多于缺陷类别
- 某些缺陷类型极少
- 成像条件和光照变化
- 像素级标注成本高
对应可以进一步研究:
- Few-label Defect Segmentation
- Rare Defect Segmentation
- Semi-supervised Industrial Inspection
- Long-tail Defect Recognition
医学稀有目标分割
部分医学分割任务同样可能存在:
- 病灶区域比例低
- 正负样本严重不平衡
- 目标边界模糊
- 图像噪声和低对比度
- 标注成本较高
在类似设置下,也可以进一步测试特征校准与伪标签动态筛选的迁移表现。
四、不只比较最终 mIoU,也可以分析“尾类为什么学不好”
论文除了最终语义分割结果之外,还对伪标签过程进行了进一步分析。
对应可以使用的指标包括:
整体性能
- mIoU
- Per-class IoU
长尾类别表现
- Head-class IoU
- Tail-class IoU
- Tail Recall
- Head–Tail Gap
伪标签质量
- Pseudo-label Accuracy
- Filtered Rate
- Correctly Kept GT Rate
- Recall
- Precision
因此,如果一个新的方法主要声称:
“改善了低频类别”
可以进一步检查:
- Tail IoU 是否真正提高
- Tail Recall 是否提高
- Head / Tail 差距是否缩小
- 尾类伪标签是否仍然大量被过滤
如果一个新的方法主要声称:
“产生了更可靠的伪标签”
则可以进一步比较:
- Pseudo-label Accuracy
- Pseudo-label Coverage
- Filtered Rate
- Correctly Kept GT Rate
- Precision / Recall
五、特征校准和阈值方法分别可以怎么比较?
FTC-Seg 的两个主要组成部分对应两类不同研究问题。
OPR:Feature / Prototype Calibration
对于新的:
- Prototype Learning
- Feature Reconstruction
- Feature Denoising
- Feature Calibration
- Foreground–Background Separation
方法,可以比较:
- mIoU
- Tail IoU
- Pseudo-label Accuracy
- Tail Pseudo-label Accuracy
- Parameters
- FLOPs
- FPS
此外也可以分析 prototype 在训练过程中对应的 dominant foreground responses。
ATC:Adaptive Threshold
对于新的:
- Fixed Threshold
- Class-specific Threshold
- Difficulty-aware Threshold
- Distribution-aware Threshold
- Confidence Calibration
- Pseudo-label Selection
方法,可以进一步比较:
- Tail Recall
- Precision
- Tail IoU
- Filtered Rate
- Pseudo-label Coverage
FTC-Seg 中 ATC 同时考虑:
- 类别当前的学习难度
- 未标注数据预测分布与标注数据类别先验之间的偏差
因此可以作为多种动态阈值方法的一个参考设置。
六、跨模态和跨成像条件比较
四个主要数据集来自明显不同的视觉环境:
| 数据集 | 模态 / 场景 | 主要问题 |
|---|---|---|
| FSSG | Forward-Looking Sonar | 散斑噪声、低纹理、长尾 |
| FLSMD | Forward-Looking Sonar | 散斑噪声、海洋垃圾、类别不均衡 |
| SUIM | Underwater Optical | 散射、低对比度、颜色退化 |
| ACDC | RGB Driving Scene | Fog / Night / Rain / Snow |
因此,同一套方法可以在:
声学感知 → 水下光学 → 常规 RGB 道路视觉
三个差异较大的场景中进行比较。
对于研究:
- Cross-domain Robustness
- Cross-modality Robustness
- Degraded-image Segmentation
- Sensor-specific Noise
- General Robust Semantic Segmentation
时,也可以参考FTC-Seg将这些作为不同类型退化条件下的实验设置。
七、计算开销
除了分割性能,论文同时报告:
- Parameters
- FLOPs
- FPS
在 DINOv2-S + DPT 的实验设置中,OPR 引入了可以忽略不计的额外参数和计算开销。
ATC 主要作用于训练阶段:
ATC 不增加推理阶段额外计算。
因此在研究:
- Efficient Segmentation
- Lightweight Semi-supervised Learning
- Accuracy / Complexity Trade-off
- Robustness / Efficiency Trade-off
时,也可以同时参考FTC-Seg比较计算成本。
八、代码与数据开放
代码、数据获取入口、数据格式整理方式、训练和推理说明均集中在同一个 GitHub 仓库中:
四个数据集统一采用:
dataset_root/ ├── Images/ └── Masks/配置文件包括:
configs/ ├── ACDC.yaml ├── FLSMD.yaml ├── FSSG.yaml └── SUIM.yaml数据路径统一在对应 YAML 文件中设置:
data_root:/path/to/dataset_root九、四个数据集的下载与整理
| 数据集 | 应用场景 | 下载入口 | 项目中的准备方式 |
|---|---|---|---|
| FSSG | 前视声呐目标分割 | 百度网盘下载 | 已整理为项目读取格式 |
| FLSMD | 前视声呐海洋垃圾与目标分割 | 百度网盘下载 | 已整理为项目读取格式 |
| SUIM | 水下光学图像分割 | 官方下载 | 提供 mask 转换、对齐和目录整理说明 |
| ACDC | 雾、夜间、雨、雪道路场景 | 官方下载 | 提供数据筛选、标注与目录整理说明 |
FSSG
FSSG 已按照项目的数据加载格式进行整理。
下载后按照配置文件设置数据根目录即可接入数据加载流程:
data_root:/path/to/FSSGFLSMD
FLSMD 同样已经整理为项目可以读取的目录格式。
按照对应配置文件设置:
data_root:/path/to/FLSMD即可使用。
SUIM
SUIM 使用官方数据。
官方下载:https://irvlab.cs.umn.edu/resources/suim-dataset
项目 README 中整理了:
- 使用的 train / validation 数据范围
- RGB mask 转 class-ID mask 的规则
- 特殊 mask 对齐处理
- 图像格式转换
- 最终
Images//Masks/目录格式
详细说明:SUIM 数据整理说明
ACDC
ACDC 使用官方数据:
rgb_anon_trainvaltest.zipgt_trainval.zip
覆盖:
- fog
- night
- rain
- snow
四种 adverse conditions。
官方下载:https://acdc.vision.ee.ethz.ch/download
README 中说明了:
- 使用哪些 train / val 文件
- 如何选择
labelTrainIds - 图像与 mask 如何整理
- 哪些数据不参与实验
- validation split 如何使用
详细说明: ACDC 数据整理说明
十、数据集原始来源与引用
使用对应数据集时,需要同时遵循原始发布方的许可要求,并引用对应数据集工作。
FSSG
Paper:CTFS: Collaborative Teacher Framework for Forward-Looking Sonar Image Semantic Segmentation with Extremely Limited Labels
Original Dataset Release Project:https://github.com/pingggg516/CTFS
FSSG 仅限非商业研究使用,使用时请注明数据来源并引用对应论文。
FLSMD
Dataset Paper:
The Marine Debris Dataset for Forward-Looking Sonar Semantic Segmentation
The Marine Debris Forward-Looking Sonar Datasets
Original Data:https://zenodo.org/records/15101686
FTC-Seg 中提供的数据副本主要用于统一项目格式,原始数据许可仍以原发布方为准。
SUIM
Paper:Semantic Segmentation of Underwater Imagery: Dataset and Benchmark
Dataset:https://irvlab.cs.umn.edu/resources/suim-dataset
ACDC
Citation:https://acdc.vision.ee.ethz.ch/citation
Dataset Homepage:https://acdc.vision.ee.ethz.ch/
十一、训练流程
1. 安装环境
按照 GitHub 中的: Installation 安装项目依赖。
2. 下载 DINOv2-S Backbone
README 中给出了 DINOv2 ViT-S/14 预训练权重的下载方式。
权重保存至:
pretrained/dinov2_small.pth3. 准备半监督训练列表
训练需要分别指定:
labeled.txt unlabeled.txt分别对应:
- 有标注训练数据
- 无标注训练数据
每一行包含:
Images/example.png Masks/example.png4. 训练
训练入口:
python train.py\--configconfigs/FSSG.yaml\--labeled-id-path /path/to/labeled.txt\--unlabeled-id-path /path/to/unlabeled.txt\--save-path ./exp/FTC-Seg/FSSG_exp具体参数可以根据:
- 数据集
- 标注比例
- Backbone
- OPR 设置
- ATC 设置
进行调整。
完整说明:Training
5. 训练输出
实验目录中会保存:
exp/FTC-Seg/FSSG_exp/ ├── train.log ├── events.out.tfevents.* ├── latest.pth └── best.pth其中:
train.log:记录训练过程和验证结果events.out.tfevents.*:TensorBoard 日志latest.pth:最近一次 checkpointbest.pth:验证集表现最好的 checkpoint
十二、推理与评估
训练完成后可以使用:
python inference.py进行推理和评估。
对应输出目录包括:
inference_results/ ├── console.log ├── progress.jsonl ├── result.json └── predictions/其中:
result.json
包含:
- mIoU
- per-class IoU
- evaluation settings
predictions/
用于保存 segmentation prediction masks。
完整说明:Inference
十三、不同研究方向可以重点比较哪些指标?
半监督语义分割
可以比较:
- mIoU
- per-class IoU
- 2% / 5% / 10% label ratio
- 不同 unlabeled-data utilization strategy
长尾分割
可以进一步比较:
- Tail IoU
- Tail Recall
- Head IoU
- Head / Tail Gap
伪标签方法
可以进一步比较:
- Pseudo-label Accuracy
- Filtered Rate
- Correctly Kept GT Rate
- Recall
- Precision
自适应阈值方法
可以比较:
- Fixed Threshold
- Difficulty-aware Threshold
- Distribution-aware Threshold
- Class-specific Threshold
- Combined Threshold Calibration
以及不同策略对以下的影响:
- Tail Recall
- Precision
- IoU
- Pseudo-label Coverage
鲁棒语义分割
可以在下述退化条件下进行比较:
- Acoustic Speckle
- Underwater Scattering
- Adverse Weather
- Synthetic Corruption
Feature / Prototype 方法
可以同时比较:
- Overall mIoU
- Tail mIoU
- Pseudo-label Quality
- Parameters
- FLOPs
- FPS
十四、项目地址
GitHub:https://github.com/pingggg516/FTC-Seg
Paper:https://arxiv.org/abs/2609.33668
关键词:
半监督语义分割、少标注学习、长尾语义分割、类别不均衡、稀有类别识别、伪标签学习、自适应阈值、鲁棒语义分割、噪声鲁棒视觉、恶劣天气分割、水下视觉、声呐图像分割、DINOv2、Teacher–Student、Pseudo-Labeling、Semantic Segmentation、Robust Segmentation、Long-tail Learning