post on 04 Jul 2026 about 2116words require 8min
CC BY 4.0 (除特别声明或转载文章外)
如果这些文字帮助到你,可以请我喝一杯咖啡~
自监督学习 (SSL) 是一种机器学习范式,在这种范式中,系统通过从数据本身生成监督信号来学习理解数据,而不是依赖外部人工提供的标签。在传统的 监督学习 中,模型需要海量的人工标注数据(例如标记为“猫”或“狗”的图像),而这通常既昂贵又费时。SSL 通过创建“预设任务”(pretext tasks)绕过了这一瓶颈,在这些任务中,模型必须预测输入数据中隐藏或缺失的部分,从而有效地让自身学习到执行复杂任务(如 目标检测 和分类)所需的底层结构和特征。
SSL的核心思想在于遮盖或者隐藏部分数据,强迫神经网络对其进行重建,或预测同一数据的不同视图之间的关系。这一过程创建了丰富、通用的特征表示,随后可以针对特定的下游应用进行微调。
自监督学习用于训练各种复杂的深度学习架构,以执行各种任务,从 BERT 和 GPT 等基于 Transformer 的大型语言模型 (LLM) 到变分自编码器 (VAE) 和生成式对抗网络 (GAN) 等图像合成模型,再到 SimCLR 和动量对比 (MoCo) 等计算机视觉模型。
SSL 中有两种常用方法:
区分 SSL 与无监督和半监督(参见:弱监督学习):
本质上,假托任务从未标记数据中产生“伪标签”,这里的伪标签是与监督学习中的人工标注的标签相区分,和半监督中的伪标签技术不一样。“假托”一词意味着训练任务本身并没有(不一定)有用:它之所以有用,仅仅是因为它向模型传授了对后续下游任务有用的数据表示。因此,假托任务通常也被称为表示学习/表征学习。
使用 SSL 预训练的模型通常会针对其特定的下游任务进行微调:这种微调通常涉及真正的监督学习(尽管仅使用监督学习训练模型所需的一小部分标记数据)。
自编码器是一种经过训练的神经网络,可以压缩(或编码)输入数据,然后使用该压缩表示形式重建(或解码)原始输入数据。他们经过训练,使用原始输入本身作为参考标准来最大限度地减少重建错误。其实就是Transformer中的编码和解码器,还有VAE变分自编码器VAE。
对比自监督学习方法为模型提供多个数据样本,并要求它们预测这些样本之间的关系。使用这些方法训练的模型通常是判别模型,而不是生成式模型。
对比模型通常使用数据-数据对进行训练,可以训练模型来区分相似和不相似事物。这些配对通常通过数据增强创建:对未标记的数据应用不同类型的转换或干扰,以创建新的实例或增强视图。但是CLIP使用的是文本-图像对。

基于实例判别的模型将训练设为一系列二元分类任务:使用一个数据样本作为目标(或“锚点”),其他数据样本被确定为“正面”(匹配)或“负面”(不匹配)。比如CLIP,SimCLR,MoCo。
有点违背直觉的是,“非对比学习”是指与对比学习密切相关的方法(而不是像人们可能猜测的那样,是对非对比学习方法的笼统概括)。模型只使用正对进行训练,学习如何最大限度地减少它们之间的差异,因此_是非对比性的_。
与对比学习相比,非对比方法相对简单:因为它们仅对正样本进行操作,所以它们使用较小的批量大小来进行训练周期,并且不需要存储库来存储负样本。这样可以节省预训练期间的内存和计算成本。
非对比模型,如 Bootstrap Your Own Latent (BYOL) 6 和 Barlow Twins7 取得了与对比和纯监督结果相当的成绩。
给定不同类型(模态)的数据点,对比方法可以学习这些模态之间的映射。例如,对比语言-图像预训练 (CLIP) 联合训练图像编码器和文本编码器,使用从互联网收集的数百万个现成的未标记(图像、文本)配对来预测哪个标题与哪个图像对应。预训练后,自然语言处理 (NLP) 用于参考训练中的视觉概念学习(甚至描述新的视觉概念),使得 CLIP 训练的模型对于各种迁移学习应用非常有用。
Related posts