拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

NeurIPS 2026|FTC-Seg 开源:面向半监督、长尾与噪声分割的可复用 Baseline,4 个数据集与复现配置已整理

NeurIPS 2026|FTC-Seg 开源:面向半监督、长尾与噪声分割的可复用 Baseline,4 个数据集与复现配置已整理

NeurIPS 2026|噪声遇上长尾:让稀有类别在少标注下获得更多学习机会

真实视觉任务中的数据往往同时具有两个特点:一方面,大量类别之间存在明显的数据不均衡,常见类别占据大量训练样本,而稀有类别只占很小一部分;另一方面,图像本身还可能受到噪声、散射、低对比度、雨雪雾等复杂成像因素影响。

对于依赖伪标签的半监督语义分割来说,这两个问题会进一步相互叠加:

噪声降低预测置信度,长尾类别本身又更难学习,最终导致稀有类别更容易在伪标签筛选阶段被过滤。

FTC-Seg(Feature-Threshold Dual Calibration)针对这一问题,从特征表示和伪标签筛选阈值两个层面进行校准。

论文:

When Noise Meets Long-Tail: Feature-Threshold Dual Calibration for Robust Pseudo-Labeling

已被NeurIPS 2026 Main Track接收。

目前已经公开:

  • 训练代码
  • 推理与评估代码
  • FLSMD / FSSG / SUIM / ACDC 四个数据集配置
  • 四个数据集的验证列表
  • 统一的数据组织格式
  • FSSG、FLSMD 整理后的数据入口
  • SUIM、ACDC 官方数据入口与完整整理说明
  • mIoU、per-class IoU 和 segmentation prediction 输出流程

GitHub:https://github.com/pingggg516/FTC-Seg

Paper:https://arxiv.org/abs/2609.33668


一、核心思路:把被过滤的稀有目标重新带回训练

图 1. FTC-Seg 通过特征与阈值双重校准,缓解尾类伪标签被持续过滤的问题。

在常见的半监督语义分割中,模型首先对未标注图像产生预测,再利用高置信度预测生成伪标签,用这些伪标签继续训练模型。

问题在于,当噪声与类别长尾同时存在时,低频类别往往会更早失去监督。

一个典型过程是:

尾类样本较少
→ 特征学习不足
→ 预测置信度偏低
→ 固定高阈值将其过滤
→ 未标注数据无法继续提供尾类监督
→ 尾类特征进一步退化

图 1(a) 中可以看到,模型实际上已经在稀有目标区域产生了预测,但预测置信度未达到统一阈值,因此这些区域在后续训练前直接被过滤。

FTC-Seg 从两个位置进行干预:

  • Orthogonal Prototype Reconstruction(OPR)
    从特征层面改善目标与噪声背景之间的可分性,使受到干扰的目标特征更容易被模型识别。

  • Adaptive Threshold Calibration(ATC)
    不再对所有类别使用完全相同的固定阈值,而是根据类别的学习状态与预测分布动态调整伪标签筛选门槛。

两部分分别作用在:

特征质量 → 预测置信度 → 伪标签筛选

这条链路的不同位置,目标都是减少低频类别由于置信度不足而被持续排除的问题。


二、跨场景验证:声呐、水下光学与恶劣天气

论文在FLSMD、FSSG、SUIM、ACDC四个公开数据集上进行实验,覆盖三种明显不同的复杂成像条件:

  • Acoustic Speckle:声学散斑
  • Underwater Optical Scattering:水下光学散射
  • Adverse-weather Imaging:恶劣天气成像

实验使用:

  • 2% 标注
  • 5% 标注
  • 10% 标注

三种半监督设置,并从整体分割性能、稀有类别表现和伪标签质量等多个角度进行分析。


ACDC:恶劣天气道路场景

图 2. ACDC 恶劣天气道路场景的分割对比,采用 2% 标注数据。Ours 为 FTC-Seg,GT 为人工标注。

ACDC 包括:

  • Fog
  • Night
  • Rain
  • Snow

等复杂道路环境。

这类场景中,小目标、低频类别和远距离道路参与者容易受到天气和成像质量影响,因此可以用于研究:

  • Robust Semantic Segmentation
  • Adverse Weather Perception
  • Autonomous Driving
  • Rare Road-user Segmentation
  • Semi-supervised Driving Scene Understanding

SUIM:水下光学场景

图 3. SUIM 水下光学场景的分割对比,采用 2% 标注数据。

水下光学图像通常同时受到:

  • 光线衰减
  • 散射
  • 低对比度
  • 色偏
  • 背景干扰

等因素影响。

因此这一设置可以用于:

  • Underwater Vision
  • Underwater Robotics
  • Robust Segmentation
  • Rare Underwater Object Recognition
  • Low-quality Image Segmentation
  • Semi-supervised Underwater Perception

FSSG / FLSMD:前视声呐场景

FSSG 和 FLSMD 均为 Forward-Looking Sonar(FLS)语义分割数据。

前视声呐图像通常具有:

  • Speckle Noise
  • 低纹理
  • 阴影
  • 目标轮廓模糊
  • 背景噪声强
  • 类别分布不均衡

等特点。

对应的研究方向包括:

  • Sonar Image Segmentation
  • Underwater Acoustic Perception
  • Marine Object Segmentation
  • Marine Debris Segmentation
  • Low-texture Semantic Segmentation
  • Noise-robust Underwater Perception

Pascal VOC:进一步的控制实验

除四个主要 benchmark 外,论文附录还在Pascal VOC上构造了:

  • Long-tail only
  • Long-tail + Gaussian noise

两种 controlled setting。

这一实验主要用于进一步检查:

“噪声与长尾共同影响伪标签学习”

这一现象是否只存在于声呐、水下光学或恶劣天气等特殊成像场景。


三、哪些研究可以把 FTC-Seg 作为 Baseline 或对比方法?

FTC-Seg 的实验设置同时涉及:

半监督学习、少标注学习、类别长尾、成像退化、稀有类别学习、伪标签筛选和类别自适应阈值。

因此,除了完全相同的“Noise + Long-tail”问题之外,在多个相关研究方向中也可以作为对比方法。

研究方向FTC-Seg 可以承担的对比角色重点比较内容
半监督语义分割Teacher–Student + Pseudo-labeling 类半监督方法mIoU、per-class IoU
少标注学习在相同 2% / 5% / 10% 标注预算下比较未标注数据利用能力不同 label ratio 下的 mIoU
长尾语义分割比较不同方法是否真正改善低频类别Tail IoU、Head/Tail Gap
类别不均衡学习与 re-weighting、re-sampling、distribution alignment 等策略比较Head / Tail performance
稀有类别识别检查新方法是否减少低频类别漏分割Tail Recall、Tail IoU
伪标签学习比较不同伪标签生成与筛选策略Pseudo-label Accuracy、Filtered Rate
自适应阈值方法与固定阈值、类别动态阈值策略进行比较Recall、Precision、Pseudo-label Coverage
Teacher–Student SSLEMA Teacher–Student 框架下的半监督分割方法mIoU、Pseudo-label Quality
DINOv2-based SegmentationDINOv2-S backbone 下的半监督分割方法精度、尾类表现、计算开销
噪声鲁棒语义分割比较低质量图像和复杂成像条件下的稳定性Robust mIoU、Tail Performance
恶劣天气分割ACDC 上比较雨、雪、雾、夜间场景mIoU、低频道路类别 IoU
水下视觉SUIM 上比较散射、低对比度条件中的分割mIoU、Rare-object IoU
声呐图像分割FSSG / FLSMD 上比较散斑噪声下的语义分割mIoU、Tail IoU
Prototype-based Segmentation与 prototype learning / feature calibration 方法比较Feature Quality、Tail IoU
Robust Pseudo-labeling比较复杂成像条件下可靠伪标签保留能力Accuracy、Coverage、Filtered Rate
Long-tail + Noise 联合鲁棒性直接分析两个因素共同存在时的性能退化Interaction、Tail Exclusion
低置信度伪标签利用比较不同方法如何利用原本会被过滤的预测Recall、Precision、Coverage
高效半监督分割同时比较性能和额外计算成本Params、FLOPs、FPS、mIoU

可以进一步迁移的任务

下面这些任务同样具有少标注、类别不均衡、稀有目标和复杂成像等特点,也很适合将 FTC-Seg 作为对比方法或迁移基线。


遥感语义分割

遥感场景中经常同时存在:

  • 稀有地物类别
  • 类别比例极度不均衡
  • 云雾与低质量成像
  • 低分辨率目标
  • 标注成本高

因此可以进一步测试:

  • Semi-supervised Remote Sensing Segmentation
  • Long-tail Remote Sensing Segmentation
  • Rare Land-cover Segmentation
  • Low-quality Remote Sensing Segmentation

工业缺陷分割

工业视觉中常见:

  • 正常类别远多于缺陷类别
  • 某些缺陷类型极少
  • 成像条件和光照变化
  • 像素级标注成本高

对应可以进一步研究:

  • Few-label Defect Segmentation
  • Rare Defect Segmentation
  • Semi-supervised Industrial Inspection
  • Long-tail Defect Recognition

医学稀有目标分割

部分医学分割任务同样可能存在:

  • 病灶区域比例低
  • 正负样本严重不平衡
  • 目标边界模糊
  • 图像噪声和低对比度
  • 标注成本较高

在类似设置下,也可以进一步测试特征校准与伪标签动态筛选的迁移表现。


四、不只比较最终 mIoU,也可以分析“尾类为什么学不好”

论文除了最终语义分割结果之外,还对伪标签过程进行了进一步分析。

对应可以使用的指标包括:

整体性能

  • mIoU
  • Per-class IoU

长尾类别表现

  • Head-class IoU
  • Tail-class IoU
  • Tail Recall
  • Head–Tail Gap

伪标签质量

  • Pseudo-label Accuracy
  • Filtered Rate
  • Correctly Kept GT Rate
  • Recall
  • Precision

因此,如果一个新的方法主要声称:

“改善了低频类别”

可以进一步检查:

  • Tail IoU 是否真正提高
  • Tail Recall 是否提高
  • Head / Tail 差距是否缩小
  • 尾类伪标签是否仍然大量被过滤

如果一个新的方法主要声称:

“产生了更可靠的伪标签”

则可以进一步比较:

  • Pseudo-label Accuracy
  • Pseudo-label Coverage
  • Filtered Rate
  • Correctly Kept GT Rate
  • Precision / Recall

五、特征校准和阈值方法分别可以怎么比较?

FTC-Seg 的两个主要组成部分对应两类不同研究问题。


OPR:Feature / Prototype Calibration

对于新的:

  • Prototype Learning
  • Feature Reconstruction
  • Feature Denoising
  • Feature Calibration
  • Foreground–Background Separation

方法,可以比较:

  • mIoU
  • Tail IoU
  • Pseudo-label Accuracy
  • Tail Pseudo-label Accuracy
  • Parameters
  • FLOPs
  • FPS

此外也可以分析 prototype 在训练过程中对应的 dominant foreground responses。


ATC:Adaptive Threshold

对于新的:

  • Fixed Threshold
  • Class-specific Threshold
  • Difficulty-aware Threshold
  • Distribution-aware Threshold
  • Confidence Calibration
  • Pseudo-label Selection

方法,可以进一步比较:

  • Tail Recall
  • Precision
  • Tail IoU
  • Filtered Rate
  • Pseudo-label Coverage

FTC-Seg 中 ATC 同时考虑:

  • 类别当前的学习难度
  • 未标注数据预测分布与标注数据类别先验之间的偏差

因此可以作为多种动态阈值方法的一个参考设置。


六、跨模态和跨成像条件比较

四个主要数据集来自明显不同的视觉环境:

数据集模态 / 场景主要问题
FSSGForward-Looking Sonar散斑噪声、低纹理、长尾
FLSMDForward-Looking Sonar散斑噪声、海洋垃圾、类别不均衡
SUIMUnderwater Optical散射、低对比度、颜色退化
ACDCRGB Driving SceneFog / Night / Rain / Snow

因此,同一套方法可以在:

声学感知 → 水下光学 → 常规 RGB 道路视觉

三个差异较大的场景中进行比较。

对于研究:

  • Cross-domain Robustness
  • Cross-modality Robustness
  • Degraded-image Segmentation
  • Sensor-specific Noise
  • General Robust Semantic Segmentation

时,也可以参考FTC-Seg将这些作为不同类型退化条件下的实验设置。


七、计算开销

除了分割性能,论文同时报告:

  • Parameters
  • FLOPs
  • FPS

在 DINOv2-S + DPT 的实验设置中,OPR 引入了可以忽略不计的额外参数和计算开销。

ATC 主要作用于训练阶段:

ATC 不增加推理阶段额外计算。

因此在研究:

  • Efficient Segmentation
  • Lightweight Semi-supervised Learning
  • Accuracy / Complexity Trade-off
  • Robustness / Efficiency Trade-off

时,也可以同时参考FTC-Seg比较计算成本。


八、代码与数据开放

代码、数据获取入口、数据格式整理方式、训练和推理说明均集中在同一个 GitHub 仓库中:

四个数据集统一采用:

dataset_root/ ├── Images/ └── Masks/

配置文件包括:

configs/ ├── ACDC.yaml ├── FLSMD.yaml ├── FSSG.yaml └── SUIM.yaml

数据路径统一在对应 YAML 文件中设置:

data_root:/path/to/dataset_root

九、四个数据集的下载与整理

数据集应用场景下载入口项目中的准备方式
FSSG前视声呐目标分割百度网盘下载已整理为项目读取格式
FLSMD前视声呐海洋垃圾与目标分割百度网盘下载已整理为项目读取格式
SUIM水下光学图像分割官方下载提供 mask 转换、对齐和目录整理说明
ACDC雾、夜间、雨、雪道路场景官方下载提供数据筛选、标注与目录整理说明

FSSG

FSSG 已按照项目的数据加载格式进行整理。

下载后按照配置文件设置数据根目录即可接入数据加载流程:

data_root:/path/to/FSSG

FLSMD

FLSMD 同样已经整理为项目可以读取的目录格式。

按照对应配置文件设置:

data_root:/path/to/FLSMD

即可使用。


SUIM

SUIM 使用官方数据。

官方下载:https://irvlab.cs.umn.edu/resources/suim-dataset

项目 README 中整理了:

  • 使用的 train / validation 数据范围
  • RGB mask 转 class-ID mask 的规则
  • 特殊 mask 对齐处理
  • 图像格式转换
  • 最终Images//Masks/目录格式

详细说明:SUIM 数据整理说明


ACDC

ACDC 使用官方数据:

  • rgb_anon_trainvaltest.zip
  • gt_trainval.zip

覆盖:

  • fog
  • night
  • rain
  • snow

四种 adverse conditions。

官方下载:https://acdc.vision.ee.ethz.ch/download

README 中说明了:

  • 使用哪些 train / val 文件
  • 如何选择labelTrainIds
  • 图像与 mask 如何整理
  • 哪些数据不参与实验
  • validation split 如何使用

详细说明: ACDC 数据整理说明


十、数据集原始来源与引用

使用对应数据集时,需要同时遵循原始发布方的许可要求,并引用对应数据集工作。


FSSG

Paper:CTFS: Collaborative Teacher Framework for Forward-Looking Sonar Image Semantic Segmentation with Extremely Limited Labels

Original Dataset Release Project:https://github.com/pingggg516/CTFS

FSSG 仅限非商业研究使用,使用时请注明数据来源并引用对应论文。


FLSMD

Dataset Paper:

The Marine Debris Dataset for Forward-Looking Sonar Semantic Segmentation

The Marine Debris Forward-Looking Sonar Datasets

Original Data:https://zenodo.org/records/15101686

FTC-Seg 中提供的数据副本主要用于统一项目格式,原始数据许可仍以原发布方为准。


SUIM

Paper:Semantic Segmentation of Underwater Imagery: Dataset and Benchmark

Dataset:https://irvlab.cs.umn.edu/resources/suim-dataset


ACDC

Citation:https://acdc.vision.ee.ethz.ch/citation

Dataset Homepage:https://acdc.vision.ee.ethz.ch/


十一、训练流程

1. 安装环境

按照 GitHub 中的: Installation 安装项目依赖。


2. 下载 DINOv2-S Backbone

README 中给出了 DINOv2 ViT-S/14 预训练权重的下载方式。

权重保存至:

pretrained/dinov2_small.pth

3. 准备半监督训练列表

训练需要分别指定:

labeled.txt unlabeled.txt

分别对应:

  • 有标注训练数据
  • 无标注训练数据

每一行包含:

Images/example.png Masks/example.png

4. 训练

训练入口:

python train.py\--configconfigs/FSSG.yaml\--labeled-id-path /path/to/labeled.txt\--unlabeled-id-path /path/to/unlabeled.txt\--save-path ./exp/FTC-Seg/FSSG_exp

具体参数可以根据:

  • 数据集
  • 标注比例
  • Backbone
  • OPR 设置
  • ATC 设置

进行调整。

完整说明:Training


5. 训练输出

实验目录中会保存:

exp/FTC-Seg/FSSG_exp/ ├── train.log ├── events.out.tfevents.* ├── latest.pth └── best.pth

其中:

  • train.log:记录训练过程和验证结果
  • events.out.tfevents.*:TensorBoard 日志
  • latest.pth:最近一次 checkpoint
  • best.pth:验证集表现最好的 checkpoint

十二、推理与评估

训练完成后可以使用:

python inference.py

进行推理和评估。

对应输出目录包括:

inference_results/ ├── console.log ├── progress.jsonl ├── result.json └── predictions/

其中:

result.json

包含:

  • mIoU
  • per-class IoU
  • evaluation settings

predictions/

用于保存 segmentation prediction masks。

完整说明:Inference


十三、不同研究方向可以重点比较哪些指标?

半监督语义分割

可以比较:

  • mIoU
  • per-class IoU
  • 2% / 5% / 10% label ratio
  • 不同 unlabeled-data utilization strategy

长尾分割

可以进一步比较:

  • Tail IoU
  • Tail Recall
  • Head IoU
  • Head / Tail Gap

伪标签方法

可以进一步比较:

  • Pseudo-label Accuracy
  • Filtered Rate
  • Correctly Kept GT Rate
  • Recall
  • Precision

自适应阈值方法

可以比较:

  • Fixed Threshold
  • Difficulty-aware Threshold
  • Distribution-aware Threshold
  • Class-specific Threshold
  • Combined Threshold Calibration

以及不同策略对以下的影响:

  • Tail Recall
  • Precision
  • IoU
  • Pseudo-label Coverage

鲁棒语义分割

可以在下述退化条件下进行比较:

  • Acoustic Speckle
  • Underwater Scattering
  • Adverse Weather
  • Synthetic Corruption

Feature / Prototype 方法

可以同时比较:

  • Overall mIoU
  • Tail mIoU
  • Pseudo-label Quality
  • Parameters
  • FLOPs
  • FPS

十四、项目地址

GitHub:https://github.com/pingggg516/FTC-Seg

Paper:https://arxiv.org/abs/2609.33668


关键词:

半监督语义分割、少标注学习、长尾语义分割、类别不均衡、稀有类别识别、伪标签学习、自适应阈值、鲁棒语义分割、噪声鲁棒视觉、恶劣天气分割、水下视觉、声呐图像分割、DINOv2、Teacher–Student、Pseudo-Labeling、Semantic Segmentation、Robust Segmentation、Long-tail Learning

返回列表