论文分享:深度半监督学习中的伪标签方法综述
在深度学习落地过程中,高精度模型的训练往往依赖大规模标注数据集。然而数据标注成本高、周期长、专业门槛高,成为制约模型迭代的重要瓶颈。与之相对,各类场景下可轻松获取海量无标注数据。在此背景下,深度半监督学习成为领域研究热点,该方向可同时利用少量标注数据与海量无标注数据完成模型训练,有效降低数据依赖。
本文结合《深度半监督学习中伪标签方法综述》一文,系统梳理伪标签技术的体系架构、主流算法、实验表现与现存挑战,为相关研究与工程应用提供参考。
一、深度半监督学习概述
机器学习可划分为监督学习、无监督学习与半监督学习三类。半监督学习介于两者之间,以少量标注样本 和大量无标注样本 共同构建模型,借助无标注数据挖掘数据分布特征,优化分类决策边界,提升模型泛化性能。
将半监督学习与深度学习融合,便形成深度半监督学习,其通用损失函数定义为:
Loss =L_{s}+w(t) × L_{u}式中 为监督损失,由标注数据计算得到; 为无监督损失,对应无标注数据; 为权重系数,用于平衡两项损失。不同算法的核心区别,集中在无监督损失的设计思路上。
当前深度半监督学习主要分为五类:生成式方法、一致性正则化方法、基于图的方法、混合方法与伪标签方法。其中,伪标签方法不受数据增强策略约束,实现难度低、适用性广,是现阶段落地价值较高的技术路线。
半监督学习的有效运作,依托三大基础假设:
- 聚类假设:同簇样本具备相同类别标签,决策边界应落在数据低密度区域;
- 平滑假设:高密度区域内距离相近的样本,类别保持一致;
- 流形假设:高维数据可映射至低维流形,流形内局部邻域样本拥有相似标签。
三类假设本质均围绕样本相似性展开,也是伪标签、标签传播等算法的设计根基。
二、伪标签方法体系分类
伪标签的核心思路为:利用初始模型为无标注数据生成虚拟标签(伪标签),扩充训练数据集并迭代优化模型。根据实现范式,可分为自训练与多视角训练两大分支。
(一)自训练
自训练依托单个模型完成伪标签生成与迭代,流程为:使用标注数据训练初始模型,依据预设置信度阈值筛选无标注样本并赋予伪标签,并入标注集循环训练,直至模型收敛。该方法通用性强,可适配图像分类、目标检测、语义分割等任务,细分主流实现如下:
- 熵最小化方法 属于熵正则化方案,通过约束无标注数据预测结果的熵值,迫使模型输出高置信度预测,避免决策边界穿过高密度样本区。该方法无法独立使用,多作为辅助模块与其他算法结合以提升效果。
- 代理标签方法 最基础的伪标签实现方案,统一将标注数据与带伪标签的无标注数据纳入监督训练。通过权重系数平衡两类数据的损失占比,同时学界也针对类别不平衡、预测置信度不均等问题完成了多项优化。
- 噪声学生模型 基于教师-学生框架,教师模型生成伪标签,再由结构更复杂的学生模型结合噪声(Dropout、随机深度等)进行训练;迭代后学生模型可升级为新教师模型,反复迭代提升模型鲁棒性,现已应用于药物研发、表情识别等领域。
- 自半监督学习方法 融合自监督学习思想,以图像旋转任务构建辅助损失,利用旋转角度预测为无标注数据生成伪标签,结合监督损失与自监督损失联合训练,综合性能表现优异。
- 元伪标签方法 改进传统教师模型固化的缺陷,引入元学习策略,让教师模型根据学生模型的学习状态动态调整伪标签分布,双向优化双模型性能,在主流图像数据集上取得了领先精度。
自训练的主要缺陷为错误累积:模型早期产生的错误伪标签,会在迭代过程中不断放大,持续影响模型效果。
(二)多视角训练
又称基于分歧的训练,核心是利用多模型、多数据视角互补生成伪标签,缓解单模型偏差问题,主要包含两类算法:
- 协同训练 要求数据具备两个相互独立、互补的特征视角,分别训练两个分类模型。两个模型交叉筛选高置信度无标注样本,互相补充训练集,通过约束模型输出一致性完成优化。该算法的局限在于,现实场景中多数数据难以天然拆分出有效双视角。
- 三体训练 无需依赖多视角数据,通过自助抽样得到三组训练集,训练三个独立模型。当两个模型对同一份无标注数据预测结果一致时,判定伪标签可信,并将样本加入第三个模型的训练集。该算法有效弥补了协同训练的短板,结合集成学习思想,整体性能更优。 在此基础上,衍生出多任务三体训练、交叉视图训练等改进方案,进一步降低计算开销、提升特征表达能力。
三、基于图与伪标签的标签传播算法
前述伪标签方法均需要预训练神经网络模型,计算复杂度偏高。而标签传播将图学习与伪标签结合,摆脱预训练依赖,是一类轻量化半监督方案。
1. 算法原理
将所有样本(含标注、无标注)构建为图结构 ,节点代表样本,边的权重表征样本间相似度。依据流形假设与聚类假设,标签会沿着高相似度节点逐步传播,完成无标注样本的标签推断。
样本间相似度权重公式:
结合权重构建概率转移矩阵,迭代执行标签传播,同时固定原始标注样本的标签,直至所有无标注样本的标签概率分布收敛。
2. 优劣分析
标签传播算法逻辑简单、运算成本低,在传统机器学习数据集上表现优于协同训练、三体训练。但也存在明显短板:图结构存储开销大,对新增样本适配性差;易受数据噪声干扰,结果稳定性不足;难以有效融合样本属性信息。
针对上述问题,学界陆续提出 GraphHop、成对约束标签传播等改进算法,不断优化算法性能。
四、实验结果对比分析
论文选取 UCI 传统数据集(Iris、Cmc、Ionosphere)与主流图像数据集(CIFAR-10、CIFAR-100、ILSVRC-2012)开展对比实验,核心结论如下:
- 图像数据集:整体精度排序为自半监督学习 > 元伪标签 > 噪声学生模型 > 熵最小化;多视角方法中,三体训练效果优于协同训练。随着分类类别数量增加,所有模型识别精度均出现下降。
- UCI 数据集:在 kNN 框架下,标签传播算法性能最优,三体训练次之,协同训练表现最弱,印证了图结构方法在传统小数据集上的优势。
综合来看,融合多思路的混合伪标签算法、基于集成思想的多视角算法,整体表现更具优势。
五、现存问题与未来研究方向
结合现有研究进展,伪标签类深度半监督学习仍面临四大核心挑战,也是未来重点研究方向:
- 无标注数据效用差异化 当前算法大多对所有无标注数据均等加权,但不同无标注样本对模型训练的贡献存在差异。如何动态评估样本价值、差异化分配权重,是优化方向之一。
- 噪声数据鲁棒性不足 现实数据集普遍存在标注噪声与样本噪声,错误伪标签会严重误导模型训练。研究噪声过滤、正则化约束、抗噪训练范式,具备较高实用价值。
- 数据采样合理性 现有采样方式易导致采样集无法代表整体数据分布,影响模型泛化。结合群优化等理论,优化采样策略,提升数据代表性。
- 多算法融合策略 单一伪标签算法存在固有缺陷,将伪标签与一致性正则化、自监督学习、图学习等技术深度融合,设计高效组合框架,是提升模型上限的关键路径。
六、总结
伪标签方法凭借简洁、通用、易落地的特性,成为深度半监督学习的主流技术。自训练、多视角训练、标签传播三类技术路线各有适用场景:深度学习场景优先选用自训练与多视角训练,传统机器学习、轻量化任务可选择标签传播算法。
目前该领域仍受错误累积、噪声干扰、采样偏差等问题制约。未来,围绕抗噪优化、动态样本加权、多算法融合、采样策略改进的研究,将持续推动伪标签技术走向成熟,进一步释放海量无标注数据的价值。